量子神经网络的贫瘠高原:表达力、梯度集中与可训练性

前置阅读:量子神经网络。建议同时翻阅附录 1:含参量子门中的参数化旋转门记号。

课程目标:

  1. 理解贫瘠高原 (Barren Plateau) 现象:参数梯度的方差随量子比特数指数衰减,训练 landscapes 变成一片"平地"。

  2. 掌握三类主要成因——过深随机线路全局型代价函数噪声——各自的物理图像与数学表述。

  3. 学会从集中测度 (concentration of measure) 的统一视角理解这些成因,以及它与第 8 章量子核方法中"核指数集中"现象的同源性。

  4. 掌握实践中的缓解策略:局部代价函数、浅层/问题启发拟设、恒等块初始化、分层训练等。

  5. 会做"梯度体检":用小模型数值验证方差随 \(n\) 的指数标度。

本课知识点

  1. 贫瘠高原现象与指数标度——能写出贫瘠高原的定义式(随机初始化下参数梯度方差随比特数 \(n\) 指数衰减),并解释它与经典"梯度消失"的区别以及 \(n=30\) 时的量级。

  2. 随机深层线路与酉 2-设计——能解释(近似)酉 2-设计的含义,写出 McClean 等人的方差上界标度 \(\mathrm{Var} \lesssim \mathrm{poly}(n)/4^n\),并用测度集中图像说明"表达力与可训练性"的张力。

  3. 全局代价与局部代价——能写出全局代价 \(C_G\) 与局部代价 \(C_L\) 的表达式,比较二者梯度方差的标度(\(\sim 2^{-n}\)\(\sim 1/\mathrm{poly}(n)\)),并证明 \(C_L \le C_G \le n\,C_L\)

  4. 噪声诱导的贫瘠高原——能计算衰减因子 \(\eta^{2L}\) 随深度的数值变化,解释方差界中信号项与噪声诱导项的来源,并说明"幸运深度"两难。

  5. 缓解策略——能列出至少四类缓解手段并把各自对应到三大成因,解释恒等块初始化为何能保住 \(O(1)\) 梯度。

  6. 集中测度的统一视角——能证明两个 Haar 随机态满足 \(\mathbb{E}\big[|\langle\psi|\phi\rangle|^2\big] = 2^{-n}\),并用集中测度统一解释贫瘠高原、量子核集中与"随机态几乎正交"。

1. 现象:训练在指数变平

回顾变分模型:参数化线路 \(U(\boldsymbol\theta)\),代价 \(C(\boldsymbol\theta) = \langle 0| U^\dagger(\boldsymbol\theta)\, H\, U(\boldsymbol\theta) |0\rangle\),用梯度下降类优化器训练。随机初始化后,若对参数采样有

\[ \mathrm{Var}_{\boldsymbol\theta}\!\left[\frac{\partial C}{\partial \theta_j}\right] \sim \frac{1}{2^{n}} \quad (\text{随比特数 } n \text{ 指数衰减}), \]

则梯度几乎处处接近零:优化器无论往哪个方向走,代价函数都几乎没有变化—— landscapes 成了"高原"。这就是 McClean 等人 (2018) 命名的贫瘠高原。注意它与经典深度学习中的"梯度消失"不同:这不是某一层的问题,而是整个参数空间的梯度范数以高概率集中到零附近(梯度分布的标准差本身指数级小),且随线路规模只会更糟。

一个量级感受:\(n = 30\)\(2^{-n} \approx 10^{-9}\);测量 \(10^9\) 次 shots 才能把梯度信噪比拉到 \(O(1)\)。贫瘠高原不是"训练慢",而是"训练在原理上不可行"。

2. 成因一:随机深层线路 —— 2-设计给出指数平坦

第一类结果(McClean et al., 2018)考虑随机结构的深层拟设(如硬件高效拟设 hardware-efficient ansatz:每层随机单比特旋转 + 纠缠门,层数据量足够)。核心结论的表述相当干净:

若参数化线路族在随机参数下构成**(近似)酉 2-设计** (unitary 2-design)——即其二阶统计性质与 Haar 随机酉一致——则对任何固定观测量 \(H\), $\( \mathrm{Var}\!\left[\partial_{\theta} C\right] = \frac{\|H - \mathrm{tr}(H)I/2^n\|^2_{\mathrm{F}}}{2^{2n+1}(2^n+1)\cdot(\text{门的结构因子})} \;\lesssim\; \frac{\mathrm{poly}(n)}{4^n}. \)$

(不同拟设的精确常数不同,但指数标度 \(4^{-n}\) 不变;注意到 \(\|H-\mathrm{tr}(H)I/2^n\|_F^2 \le \|H\|_F^2 \le 2^n\|H\|^2\),对局部 \(H\) 给出 \(\mathrm{Var} \lesssim 2^{-n}\)。)

物理图像:表达力过头的代价。2-设计意味着线路"太随机了"——它能覆盖整个酉群的一切统计性质,代价函数因此对任何参数扰动都极其迟钝。直觉与测度集中 (concentration of measure) 相连:高维酉群上的 Lipschitz 函数(代价函数正是)在 Haar 测度下以极高概率落在均值附近的窄带里,带宽 \(\sim 1/\sqrt{\text{维度}} \sim 2^{-n}\)表达力与可训练性在这里成了直接的对手:越"万能"的拟设, landscapes 越平。

这不是哲学批评而是可计算的判据:给定拟设,可以数值检验其偏离 2-设计的程度(如比较其二阶矩与 Weingarten 函数给出的 Haar 值),从而预判高原风险。

3. 成因二:代价函数的"全局性" —— 浅层也会高原

第二类结果 (Uvarov, Kardashin & Biamonte, 2020) 给出更微妙的警告:即使线路很浅,只要代价函数是"全局"的,高原依然出现

对比两种代价。设目标态为 \(|\psi\rangle\),拟设输出 \(|\phi(\boldsymbol\theta)\rangle = U(\boldsymbol\theta)|0\rangle\)

  • 全局代价\(C_G = 1 - |\langle\psi|\phi\rangle|^2\)(整体保真度);

  • 局部代价\(C_L = 1 - \frac1n \sum_{i=1}^n \langle\phi| \Pi_i |\phi\rangle\)\(\Pi_i\) 只作用在第 \(i\) 个比特上的投影(把 \(|\psi\rangle\) 的对应比特投影到 \(|\psi\rangle\)\(i\) 比特的状态)。

两个代价在描述"离目标多远"上等价——\(C_L \le C_G \le n\, C_L\)(相差一个多项式因子)。但梯度行为天差地别:对局部观测量加某种结构性假设,有

\[ \mathrm{Var}[\partial_\theta C_G] \sim \frac{1}{2^n}, \qquad \mathrm{Var}[\partial_\theta C_L] \sim \frac{1}{\mathrm{poly}(n)} \ \text{(随 } n \text{ 多项式衰减甚至不衰)}. \]

物理图像:非正交态的可分辨性。全局代价要"看"整个 \(2^n\) 维态矢,而两个 Haar 随机态几乎正交(\(|\langle\psi|\phi\rangle| \sim 2^{-n/2}\)),微调参数几乎不改变重叠——所以指数平坦。局部代价只要求逐比特对齐,而逐比特的"方向"在低维空间里变化是多项式级的。启示:写代价函数时,能用局部量就用局部量——这在量子化学里对应"把整体保真度换成局域可观测量"的习惯。

4. 成因三:噪声 —— 指数衰减的另一种来源

第三类结果 (Wang et al., 2021) 表明,退相干噪声本身制造高原,与线路深度、代价函数类型无关。设每层噪声把密度矩阵朝最大混合态方向衰减因子 \(\eta = e^{-\varepsilon}\)\(\varepsilon\) 为单层有效错误率),则对深度 \(L\) 的线路,

\[ \mathrm{Var}[\partial_\theta C] \;\lesssim\; \eta^{2L}\ (\text{无噪声方差}) + O\!\left(\frac{(1-\eta^L)^2}{2^n}\right) \cdot \text{(噪声诱导项)}. \]

两项都是坏消息:第一项随深度指数衰减(信号被噪声吃掉),第二项在深度大时把方差拉向 \(2^{-n}\) 级(态趋向最大混合,梯度信息丢失)。由此得到著名的"幸运深度" (lucky depth) 图像:深度必须随 \(\log(1/\varepsilon)\) 增长才能表达足够复杂的态,但方差却随深度指数缩水——NISQ 时代的变分算法被夹在中间,能可靠训练的规模存在原理性上限。这也解释了为什么第 5、6 章的容错算法路线在长期竞争中不可或缺。

5. 缓解策略:与高原共处的工程学

没有一招通杀,但有一组互补手段,实践中常组合使用:

  1. 浅层 + 问题启发拟设 (problem-inspired ansatz)。用物理/结构先验压缩参数空间(如 UCC、哈密顿量项对应的 Trotter 层、对称性适配层),避免"随机万能线路"。表达力换可训练性——但小心:拟设太弱会陷入"高原没了、最优解也不在参数空间里"的另一种失败。

  2. 局部代价函数(第 3 节):多项式级方差。

  3. 恒等块初始化 / 热启动 (identity-block initialization, warm start)。把初始参数设在使整块线路近似恒等的位置,梯度保持 \(O(1)\);或用经典近似解、前一层的优化结果做初始化。

  4. 分层/逐块训练 (layerwise training)。每次只训练一薄层,单层 landscapes 尚未进入 2-设计区;代价是需要外层调度。

  5. 对称性与守恒量。在正确的对称扇区内工作等效于缩小希尔伯特空间,抑制集中。

  6. 参数关联与过度参数化 (overparametrization)。近期研究显示,当参数多到使损失 landscapes 出现"丰饶盆地"(训练分岔充分多)时,局部极小值质量显著改善——与贫瘠高原并不矛盾:高原是初始化区域的性质,过度参数化改变的是全局 landscapes 几何

  7. 数值体检先行。训练前先在小系统 (\(n \le 12\)) 扫梯度直方图:若方差随 \(n\) 明显指数衰减,先改拟设/代价函数,再谈扩大规模。

6. 统一视角:集中测度

最后指出一个统一视角:贫瘠高原、量子核的指数集中(第 8 章)、以及"随机态几乎正交",都是高维希尔伯特空间集中测度的不同侧面。理解了"高维空间里随机的东西全都长得一样"这一点,NISQ 算法设计中一半的"为什么"就有了答案。

本课总结

  • 贫瘠高原 = 梯度方差随比特数指数衰减;\(n=30\) 时已不可训练。

  • 三大成因:随机深层线路(2-设计,\(\mathrm{Var}\sim 4^{-n}\) 量级)、全局代价函数(浅层也平,局部代价可救回多项式级)、噪声(随深度指数衰减 + 最大混合化)。

  • 统一图像是高维集中测度;表达力与可训练性存在张力。

  • 实践对策:问题启发浅拟设、局部代价、恒等初始化、分层训练、对称性、先做小规模梯度体检。

练习题

练习 1【贫瘠高原现象与指数标度】(→ 第 1 节

  1. 基础:写出贫瘠高原的定义式;计算 \(2^{-n}\)\(n = 20\)\(n = 30\) 处的值,并说明为什么把梯度信噪比拉回 \(O(1)\) 至少需要 \(O(2^n)\) 次 shots。

  2. 进阶:设 \(C(\theta) = \langle 0| R_z(\theta)^{\otimes n}\, Z_1\, R_z(\theta)^{\otimes n\,\dagger} |0\rangle\)。证明 \(\partial_\theta C \equiv 0\)(且把 \(Z_1\) 换成任何观测量结论都不变),并解释这种"构造出来的平坦方向"为何不是贫瘠高原;再把 \(R_z\) 换成 \(R_y\),证明 \(C(\theta) = \cos\theta\),并验证 \(\mathrm{Var}_\theta[\partial_\theta C] = \frac{1}{2}\)\(n\) 无关。

提示:\(|0\rangle^{\otimes n}\) 是所有 \(R_z(\theta)\) 的公共本征态,演化只带来全局相位;而 \(R_y(\theta)|0\rangle = \cos\frac{\theta}{2}|0\rangle + \sin\frac{\theta}{2}|1\rangle\)

练习 2【随机深层线路与酉 2-设计】(→ 第 2 节

  1. 基础:用自己的话写出(近似)酉 2-设计的含义,并解释为什么"层数足够"的硬件高效拟设在随机参数下会趋近这一性质。

  2. 进阶:解释"表达力与可训练性"的张力:为什么拟设越接近 2-设计,landscapes 越平?请用 Haar 测度下 Lipschitz 代价函数集中到均值附近窄带(带宽 \(\sim 2^{-n}\))的图像回答。

提示:代价函数正是高维酉群上的 Lipschitz 函数,其带宽 \(\sim 1/\sqrt{\text{维度}} \sim 2^{-n}\)

练习 3【全局代价与局部代价】(→ 第 3 节

  1. 基础:写出 \(C_G\)\(C_L\) 的表达式,分别给出二者梯度方差的标度(\(\sim 2^{-n}\)\(\sim 1/\mathrm{poly}(n)\)),并用"两个 Haar 随机态几乎正交(\(|\langle\psi|\phi\rangle| \sim 2^{-n/2}\))"解释全局代价为何指数平坦。

  2. 进阶:证明 \(C_L \le C_G \le n\, C_L\)

提示:若全局保真度高则逐比特都接近;反之逐比特投影均值高,则由 Cauchy–Schwarz 推出全局重叠的下界。

练习 4【噪声诱导的贫瘠高原】(→ 第 4 节

  1. 基础:设单层有效错误率 \(\varepsilon = 0.01\)\(\eta = e^{-\varepsilon}\)),计算 \(\eta^{2L}\)\(L = 50\)\(L = 100\) 处的值,并回答深度从 50 增至 100 时信号项缩小为原来的多少倍。

  2. 进阶:解释方差界中两项各自的来源:为什么信号项携带因子 \(\eta^{2L}\) 而不是 \(\eta^L\)?为什么深度大时第二项把方差拉向 \(2^{-n}\) 量级?据此说明"幸运深度"两难为何给 NISQ 变分算法的可靠训练规模设置了原理性上限。

提示:理想分量的振幅每层衰减一个因子 \(\eta\)\(L\) 层后梯度信号是 \(\eta^L\) 倍,而方差是梯度的平方。

练习 5【缓解策略】(→ 第 5 节

  1. 基础:列出至少四类缓解手段,并各用一句话指出它针对的成因或失败模式(例如:问题启发浅拟设针对随机深层线路的 2-设计化;局部代价针对全局代价的指数集中;浅层线路针对噪声随深度的指数衰减)。

  2. 进阶:解释"恒等块初始化/热启动"为何能保住 \(O(1)\) 梯度;并说明为什么"过度参数化带来丰饶盆地"与"初始化区域是贫瘠高原"并不矛盾。

  3. 数值体检:对硬件高效拟设(\(L\) 层,每层 \(R_y\!-\!R_z\) 加线性纠缠),取 \(n = 4, 6, 8, 10\),随机参数采样估计 \(\mathrm{Var}[\partial_{\theta_{1,1}} C]\),画 \(\log_2 \mathrm{Var}\)\(n\) 的图;再固定 \(n\)、对 \(L = 2, 4, \ldots, 40\) 画对深度的图,观察进入高原的深度阈值。

提示:在恒等块附近,参数微扰等价于直接对初态加小旋转,作用不经过高维随机化;高原是初始化区域的性质,过度参数化改变的是全局 landscapes 几何。

练习 6【集中测度的统一视角】(→ 第 6 节

  1. 基础:用一句话概括"高维希尔伯特空间中的随机对象都长得一样"这一集中测度图像,并指出贫瘠高原、量子核的指数集中、"随机态几乎正交"分别是它的哪一个侧面。

  2. 进阶:证明两个独立的 Haar 随机态满足 \(\mathbb{E}\big[|\langle\psi|\phi\rangle|^2\big] = 2^{-n}\),并据此说明为什么对 2-设计拟设微调参数几乎不改变全局重叠。

提示:由酉不变性不妨取 \(|\phi\rangle = |0\rangle^{\otimes n}\);再由对称性,\(d = 2^n\) 个坐标模方的均值彼此相等且总和为 1。