- 命题框:随机初始化下 Var_θ[∂C/∂θⱼ] ∼ 2⁻ⁿ(其中 C(θ) = ⟨0|U†(θ)·H·U(θ)|0⟩)——梯度几乎处处接近零;与经典"梯度消失"不同:是整个参数空间的梯度范数集中到零附近
- 演算(shots 账,逐行):
1. 2⁻²⁰ ≈ 9.5×10⁻⁷;2⁻³⁰ ≈ 9.3×10⁻¹⁰
2. 梯度信号 ∼ √Var = 2^(−n/2),单次测量噪声 O(1) → 信噪比拉回 O(1) 需 O(2ⁿ) 次 shots
3. n = 30 → 约 10⁹ 次测量——不是训练慢,是原理上不可行
- 成因一(随机深层线路,McClean 等 2018):层数足够的硬件高效拟设逼近(近似)酉 2-设计 → Var ≲ poly(n)/4ⁿ(局部观测量约 2⁻ⁿ)——表达力与可训练性直接对立
- 成因二(全局代价,Uvarov 等 2020):C_G = 1 − |⟨ψ|φ⟩|²(整体保真度)vs C_L = 1 − (1/n)·Σᵢ⟨φ|Πᵢ|φ⟩(逐比特投影);二者等价刻度 C_L ≤ C_G ≤ n·C_L,但 Var[∂C_G] ∼ 2⁻ⁿ 而 Var[∂C_L] ∼ 1/poly(n)——病根:两个随机态重叠仅 ~2^(−n/2),微调参数改不动;启示:能用局部量就用局部量
- 成因三(噪声,Wang 等 2021):每层衰减因子 η = e^(−ε),Var ≲ η^(2L)·(无噪声方差) + O((1−η^L)²/2ⁿ);演算:ε = 0.01 → η = e^(−0.01) ≈ 0.990,L = 50 → η^100 ≈ e^(−1) ≈ 0.37,L = 100 → η^200 ≈ e^(−2) ≈ 0.135——深度每加 50 层信号项再乘 e^(−1);"幸运深度"两难:深度须随 log(1/ε) 增长而方差随深度指数缩水