# 量子神经网络的贫瘠高原:表达力、梯度集中与可训练性 *前置阅读:[量子神经网络](quantum-neural-network.md)。建议同时翻阅[附录 1:含参量子门](parametrized-gates-appendix.md)中的参数化旋转门记号。* **课程目标:** 1. 理解**贫瘠高原 (Barren Plateau)** 现象:参数梯度的方差随量子比特数指数衰减,训练 landscapes 变成一片"平地"。 2. 掌握三类主要成因——**过深随机线路**、**全局型代价函数**、**噪声**——各自的物理图像与数学表述。 3. 学会从**集中测度 (concentration of measure)** 的统一视角理解这些成因,以及它与第 8 章量子核方法中"核指数集中"现象的同源性。 4. 掌握实践中的缓解策略:局部代价函数、浅层/问题启发拟设、恒等块初始化、分层训练等。 5. 会做"梯度体检":用小模型数值验证方差随 $n$ 的指数标度。 :::{admonition} 本课知识点 :class: tip 1. **[贫瘠高原现象与指数标度](#barren-plateau-phenomenon)**——能写出贫瘠高原的定义式(随机初始化下参数梯度方差随比特数 $n$ 指数衰减),并解释它与经典"梯度消失"的区别以及 $n=30$ 时的量级。 2. **[随机深层线路与酉 2-设计](#unitary-2-design)**——能解释(近似)酉 2-设计的含义,写出 McClean 等人的方差上界标度 $\mathrm{Var} \lesssim \mathrm{poly}(n)/4^n$,并用测度集中图像说明"表达力与可训练性"的张力。 3. **[全局代价与局部代价](#global-vs-local-cost)**——能写出全局代价 $C_G$ 与局部代价 $C_L$ 的表达式,比较二者梯度方差的标度($\sim 2^{-n}$ 对 $\sim 1/\mathrm{poly}(n)$),并证明 $C_L \le C_G \le n\,C_L$。 4. **[噪声诱导的贫瘠高原](#noise-induced-plateau)**——能计算衰减因子 $\eta^{2L}$ 随深度的数值变化,解释方差界中信号项与噪声诱导项的来源,并说明"幸运深度"两难。 5. **[缓解策略](#mitigation-strategies)**——能列出至少四类缓解手段并把各自对应到三大成因,解释恒等块初始化为何能保住 $O(1)$ 梯度。 6. **[集中测度的统一视角](#concentration-of-measure)**——能证明两个 Haar 随机态满足 $\mathbb{E}\big[|\langle\psi|\phi\rangle|^2\big] = 2^{-n}$,并用集中测度统一解释贫瘠高原、量子核集中与"随机态几乎正交"。 ::: (barren-plateau-phenomenon)= ## 1. 现象:训练在指数变平 回顾变分模型:参数化线路 $U(\boldsymbol\theta)$,代价 $C(\boldsymbol\theta) = \langle 0| U^\dagger(\boldsymbol\theta)\, H\, U(\boldsymbol\theta) |0\rangle$,用梯度下降类优化器训练。随机初始化后,若对参数采样有 $$ \mathrm{Var}_{\boldsymbol\theta}\!\left[\frac{\partial C}{\partial \theta_j}\right] \sim \frac{1}{2^{n}} \quad (\text{随比特数 } n \text{ 指数衰减}), $$ 则梯度几乎处处接近零:优化器无论往哪个方向走,代价函数都几乎没有变化—— landscapes 成了"高原"。这就是 McClean 等人 (2018) 命名的贫瘠高原。注意它与经典深度学习中的"梯度消失"不同:这不是某一层的问题,而是**整个参数空间的梯度范数以高概率集中到零附近**(梯度分布的标准差本身指数级小),且随线路规模只会更糟。 一个量级感受:$n = 30$ 时 $2^{-n} \approx 10^{-9}$;测量 $10^9$ 次 shots 才能把梯度信噪比拉到 $O(1)$。贫瘠高原不是"训练慢",而是"训练在原理上不可行"。 (unitary-2-design)= ## 2. 成因一:随机深层线路 —— 2-设计给出指数平坦 第一类结果(McClean et al., 2018)考虑**随机结构的深层拟设**(如硬件高效拟设 hardware-efficient ansatz:每层随机单比特旋转 + 纠缠门,层数据量足够)。核心结论的表述相当干净: > 若参数化线路族在随机参数下构成**(近似)酉 2-设计** (unitary 2-design)——即其二阶统计性质与 Haar 随机酉一致——则对任何固定观测量 $H$, > $$ \mathrm{Var}\!\left[\partial_{\theta} C\right] = \frac{\|H - \mathrm{tr}(H)I/2^n\|^2_{\mathrm{F}}}{2^{2n+1}(2^n+1)\cdot(\text{门的结构因子})} \;\lesssim\; \frac{\mathrm{poly}(n)}{4^n}. $$ (不同拟设的精确常数不同,但指数标度 $4^{-n}$ 不变;注意到 $\|H-\mathrm{tr}(H)I/2^n\|_F^2 \le \|H\|_F^2 \le 2^n\|H\|^2$,对局部 $H$ 给出 $\mathrm{Var} \lesssim 2^{-n}$。) **物理图像:表达力过头的代价**。2-设计意味着线路"太随机了"——它能覆盖整个酉群的一切统计性质,代价函数因此对任何参数扰动都极其迟钝。直觉与测度集中 (concentration of measure) 相连:高维酉群上的 Lipschitz 函数(代价函数正是)在 Haar 测度下以极高概率落在均值附近的窄带里,带宽 $\sim 1/\sqrt{\text{维度}} \sim 2^{-n}$。**表达力与可训练性在这里成了直接的对手**:越"万能"的拟设, landscapes 越平。 这不是哲学批评而是可计算的判据:给定拟设,可以数值检验其偏离 2-设计的程度(如比较其二阶矩与 Weingarten 函数给出的 Haar 值),从而预判高原风险。 (global-vs-local-cost)= ## 3. 成因二:代价函数的"全局性" —— 浅层也会高原 第二类结果 (Uvarov, Kardashin & Biamonte, 2020) 给出更微妙的警告:**即使线路很浅,只要代价函数是"全局"的,高原依然出现**。 对比两种代价。设目标态为 $|\psi\rangle$,拟设输出 $|\phi(\boldsymbol\theta)\rangle = U(\boldsymbol\theta)|0\rangle$: - **全局代价**:$C_G = 1 - |\langle\psi|\phi\rangle|^2$(整体保真度); - **局部代价**:$C_L = 1 - \frac1n \sum_{i=1}^n \langle\phi| \Pi_i |\phi\rangle$,$\Pi_i$ 只作用在第 $i$ 个比特上的投影(把 $|\psi\rangle$ 的对应比特投影到 $|\psi\rangle$ 第 $i$ 比特的状态)。 两个代价在描述"离目标多远"上等价——$C_L \le C_G \le n\, C_L$(相差一个多项式因子)。但梯度行为天差地别:对局部观测量加某种结构性假设,有 $$ \mathrm{Var}[\partial_\theta C_G] \sim \frac{1}{2^n}, \qquad \mathrm{Var}[\partial_\theta C_L] \sim \frac{1}{\mathrm{poly}(n)} \ \text{(随 } n \text{ 多项式衰减甚至不衰)}. $$ **物理图像:非正交态的可分辨性**。全局代价要"看"整个 $2^n$ 维态矢,而两个 Haar 随机态几乎正交($|\langle\psi|\phi\rangle| \sim 2^{-n/2}$),微调参数几乎不改变重叠——所以指数平坦。局部代价只要求逐比特对齐,而逐比特的"方向"在低维空间里变化是多项式级的。**启示:写代价函数时,能用局部量就用局部量**——这在量子化学里对应"把整体保真度换成局域可观测量"的习惯。 (noise-induced-plateau)= ## 4. 成因三:噪声 —— 指数衰减的另一种来源 第三类结果 (Wang et al., 2021) 表明,**退相干噪声本身制造高原**,与线路深度、代价函数类型无关。设每层噪声把密度矩阵朝最大混合态方向衰减因子 $\eta = e^{-\varepsilon}$($\varepsilon$ 为单层有效错误率),则对深度 $L$ 的线路, $$ \mathrm{Var}[\partial_\theta C] \;\lesssim\; \eta^{2L}\ (\text{无噪声方差}) + O\!\left(\frac{(1-\eta^L)^2}{2^n}\right) \cdot \text{(噪声诱导项)}. $$ 两项都是坏消息:第一项随深度指数衰减(信号被噪声吃掉),第二项在深度大时把方差拉向 $2^{-n}$ 级(态趋向最大混合,梯度信息丢失)。由此得到著名的"幸运深度" (lucky depth) 图像:**深度必须随 $\log(1/\varepsilon)$ 增长才能表达足够复杂的态,但方差却随深度指数缩水**——NISQ 时代的变分算法被夹在中间,能可靠训练的规模存在原理性上限。这也解释了为什么第 5、6 章的容错算法路线在长期竞争中不可或缺。 (mitigation-strategies)= ## 5. 缓解策略:与高原共处的工程学 没有一招通杀,但有一组互补手段,实践中常组合使用: 1. **浅层 + 问题启发拟设 (problem-inspired ansatz)**。用物理/结构先验压缩参数空间(如 UCC、哈密顿量项对应的 Trotter 层、对称性适配层),避免"随机万能线路"。表达力换可训练性——但小心:拟设太弱会陷入"高原没了、最优解也不在参数空间里"的另一种失败。 2. **局部代价函数**(第 3 节):多项式级方差。 3. **恒等块初始化 / 热启动 (identity-block initialization, warm start)**。把初始参数设在使整块线路近似恒等的位置,梯度保持 $O(1)$;或用经典近似解、前一层的优化结果做初始化。 4. **分层/逐块训练 (layerwise training)**。每次只训练一薄层,单层 landscapes 尚未进入 2-设计区;代价是需要外层调度。 5. **对称性与守恒量**。在正确的对称扇区内工作等效于缩小希尔伯特空间,抑制集中。 6. **参数关联与过度参数化 (overparametrization)**。近期研究显示,当参数多到使损失 landscapes 出现"丰饶盆地"(训练分岔充分多)时,局部极小值质量显著改善——与贫瘠高原并不矛盾:高原是**初始化区域**的性质,过度参数化改变的是**全局 landscapes 几何**。 7. **数值体检先行**。训练前先在小系统 ($n \le 12$) 扫梯度直方图:若方差随 $n$ 明显指数衰减,先改拟设/代价函数,再谈扩大规模。 (concentration-of-measure)= ## 6. 统一视角:集中测度 最后指出一个统一视角:贫瘠高原、量子核的指数集中(第 8 章)、以及"随机态几乎正交",都是**高维希尔伯特空间集中测度**的不同侧面。理解了"高维空间里随机的东西全都长得一样"这一点,NISQ 算法设计中一半的"为什么"就有了答案。 ## 本课总结 - 贫瘠高原 = 梯度方差随比特数指数衰减;$n=30$ 时已不可训练。 - 三大成因:随机深层线路(2-设计,$\mathrm{Var}\sim 4^{-n}$ 量级)、全局代价函数(浅层也平,局部代价可救回多项式级)、噪声(随深度指数衰减 + 最大混合化)。 - 统一图像是高维集中测度;表达力与可训练性存在张力。 - 实践对策:问题启发浅拟设、局部代价、恒等初始化、分层训练、对称性、先做小规模梯度体检。 ## 练习题 **练习 1【贫瘠高原现象与指数标度】**(→ [第 1 节](#barren-plateau-phenomenon)) 1. 基础:写出贫瘠高原的定义式;计算 $2^{-n}$ 在 $n = 20$ 与 $n = 30$ 处的值,并说明为什么把梯度信噪比拉回 $O(1)$ 至少需要 $O(2^n)$ 次 shots。 2. 进阶:设 $C(\theta) = \langle 0| R_z(\theta)^{\otimes n}\, Z_1\, R_z(\theta)^{\otimes n\,\dagger} |0\rangle$。证明 $\partial_\theta C \equiv 0$(且把 $Z_1$ 换成任何观测量结论都不变),并解释这种"构造出来的平坦方向"为何不是贫瘠高原;再把 $R_z$ 换成 $R_y$,证明 $C(\theta) = \cos\theta$,并验证 $\mathrm{Var}_\theta[\partial_\theta C] = \frac{1}{2}$ 与 $n$ 无关。 > 提示:$|0\rangle^{\otimes n}$ 是所有 $R_z(\theta)$ 的公共本征态,演化只带来全局相位;而 $R_y(\theta)|0\rangle = \cos\frac{\theta}{2}|0\rangle + \sin\frac{\theta}{2}|1\rangle$。 **练习 2【随机深层线路与酉 2-设计】**(→ [第 2 节](#unitary-2-design)) 1. 基础:用自己的话写出(近似)酉 2-设计的含义,并解释为什么"层数足够"的硬件高效拟设在随机参数下会趋近这一性质。 2. 进阶:解释"表达力与可训练性"的张力:为什么拟设越接近 2-设计,landscapes 越平?请用 Haar 测度下 Lipschitz 代价函数集中到均值附近窄带(带宽 $\sim 2^{-n}$)的图像回答。 > 提示:代价函数正是高维酉群上的 Lipschitz 函数,其带宽 $\sim 1/\sqrt{\text{维度}} \sim 2^{-n}$。 **练习 3【全局代价与局部代价】**(→ [第 3 节](#global-vs-local-cost)) 1. 基础:写出 $C_G$ 与 $C_L$ 的表达式,分别给出二者梯度方差的标度($\sim 2^{-n}$ 对 $\sim 1/\mathrm{poly}(n)$),并用"两个 Haar 随机态几乎正交($|\langle\psi|\phi\rangle| \sim 2^{-n/2}$)"解释全局代价为何指数平坦。 2. 进阶:证明 $C_L \le C_G \le n\, C_L$。 > 提示:若全局保真度高则逐比特都接近;反之逐比特投影均值高,则由 Cauchy–Schwarz 推出全局重叠的下界。 **练习 4【噪声诱导的贫瘠高原】**(→ [第 4 节](#noise-induced-plateau)) 1. 基础:设单层有效错误率 $\varepsilon = 0.01$($\eta = e^{-\varepsilon}$),计算 $\eta^{2L}$ 在 $L = 50$ 与 $L = 100$ 处的值,并回答深度从 50 增至 100 时信号项缩小为原来的多少倍。 2. 进阶:解释方差界中两项各自的来源:为什么信号项携带因子 $\eta^{2L}$ 而不是 $\eta^L$?为什么深度大时第二项把方差拉向 $2^{-n}$ 量级?据此说明"幸运深度"两难为何给 NISQ 变分算法的可靠训练规模设置了原理性上限。 > 提示:理想分量的振幅每层衰减一个因子 $\eta$,$L$ 层后梯度信号是 $\eta^L$ 倍,而方差是梯度的平方。 **练习 5【缓解策略】**(→ [第 5 节](#mitigation-strategies)) 1. 基础:列出至少四类缓解手段,并各用一句话指出它针对的成因或失败模式(例如:问题启发浅拟设针对随机深层线路的 2-设计化;局部代价针对全局代价的指数集中;浅层线路针对噪声随深度的指数衰减)。 2. 进阶:解释"恒等块初始化/热启动"为何能保住 $O(1)$ 梯度;并说明为什么"过度参数化带来丰饶盆地"与"初始化区域是贫瘠高原"并不矛盾。 3. 数值体检:对硬件高效拟设($L$ 层,每层 $R_y\!-\!R_z$ 加线性纠缠),取 $n = 4, 6, 8, 10$,随机参数采样估计 $\mathrm{Var}[\partial_{\theta_{1,1}} C]$,画 $\log_2 \mathrm{Var}$ 对 $n$ 的图;再固定 $n$、对 $L = 2, 4, \ldots, 40$ 画对深度的图,观察进入高原的深度阈值。 > 提示:在恒等块附近,参数微扰等价于直接对初态加小旋转,作用不经过高维随机化;高原是初始化区域的性质,过度参数化改变的是全局 landscapes 几何。 **练习 6【集中测度的统一视角】**(→ [第 6 节](#concentration-of-measure)) 1. 基础:用一句话概括"高维希尔伯特空间中的随机对象都长得一样"这一集中测度图像,并指出贫瘠高原、量子核的指数集中、"随机态几乎正交"分别是它的哪一个侧面。 2. 进阶:证明两个独立的 Haar 随机态满足 $\mathbb{E}\big[|\langle\psi|\phi\rangle|^2\big] = 2^{-n}$,并据此说明为什么对 2-设计拟设微调参数几乎不改变全局重叠。 > 提示:由酉不变性不妨取 $|\phi\rangle = |0\rangle^{\otimes n}$;再由对称性,$d = 2^n$ 个坐标模方的均值彼此相等且总和为 1。