第一讲 绪论:从量子力学到量子信息科学
计算机能多快解出一道题,为什么会取决于量子物理? 从21与RSA提出问题,回到光和原子催生量子力学的实验,再从叠加、测量与纠缠走向可控的多比特联合态,最后用Shor算法回应整数分解的悬念。
本讲依次讨论整数分解、量子力学、量子信息、光与控制。正文沿课堂的问题顺序展开;折叠框保留数学准备、完整推导和延伸实验,课后可以按需阅读。视频与示意图帮助重看现象,解释和结论也写在正文中。
1.1 整数分解:从21开始
给你整数21,要求找出它的素因子。我们很快会写下
\[21=3\times7.\]
换一个数:
\[221=\ ?\]
它仍然是两个素数的乘积。能否找出这两个因子?
\[221=13\times17.\]
给出13和17后,只需计算它们的乘积,就能验证这个分解;寻找因子时,候选答案还没有给出。
现在请看第三个数。下面换行显示的所有数字,合起来是同一个250位整数,名叫RSA-250:
2140324650240744961264423072839333563008614715144755017797754920881418023447140136643345519095804679610992851872470914587687396261921557363047454770520805119056493106687691590019759405693457452230589325976697471681738069364894699871578494975937497937
它也是两个素数的乘积。题目仍然只有一句话:找出这两个素数。从21到221,我们还可以靠心算和纸笔往前走;面对这250位数字,在一堂课里靠逐个试除找出答案已经没有可行性。那么,把任务交给每秒能做海量运算的计算机,能不能很快完成?
RSA:为什么整数分解关系到信息安全?
RSA是一种公钥密码。公钥可以公开,私钥需要保密;公钥中包含两个大素数的乘积 \(N=pq\)。如果能从公开的 \(N\) 高效找回 \(p\)、\(q\),就能进一步计算对应私钥。因此,整数分解的难易具有实际意义。私钥并不简单等于两个素因子,RSA的安全使用还涉及编码、填充和具体协议。
这里要区分两个名称:RSA-250是一个250位十进制整数的分解挑战;RSA-2048中的2048指密码模数的二进制位数。 它们不是同一种位数单位,也不是密码算法的版本号。高效分解足以威胁RSA,但不能反过来把所有RSA攻击都等同于整数分解 [2, 14]。
拿到因子后,乘回去验证很容易;只有乘积时,寻找因子可能很难。计算复杂性关心的正是:输入增长时,完成任务所需的工作量怎样增长。课堂提到的P与NP是判定问题的分类:P要求能够在经典多项式时间内判定;NP要求“是”的答案具有能在经典多项式时间内核验的证据。分解整数通常表述为搜索或函数问题;验证因子容易,并不自动证明寻找因子难,也不说明分解是NP完全问题。
输入规模:为什么要关心增长规律?
对21和221,我们可以尝试除以小素数;对数百位整数,这种逐个尝试的方法会迅速变得不切实际。朴素试除需要检查到平方根附近;对大小相近的两个素因子的乘积,十进制位数每增加两位,试除上限约增大10倍。这个估算描述一种算法,不能当作所有经典方法的下界。
试除法的复杂度:位数增加,计算量怎样增长?
先让计算机做我们刚才做的事:从小到大尝试可能的因子。若 \(N=uv\),至少一个因子不超过 \(\sqrt N\);否则两者都大于 \(\sqrt N\),乘积就会超过 \(N\)。因此,最朴素的办法是一路检查到 \(\sqrt N\) 附近。
对两个大小相近的大素数的乘积,小因子也在这个尺度。如果 \(N\) 有 \(d\) 位十进制数字,它的大小在 \(10^{d-1}\) 与 \(10^d\) 之间,逐个试除的次数便可达到约
\[\sqrt{10^d}=10^{d/2}\]
这一量级。输入每增加两位,搜索上限就约增大10倍;增加20位,就约增大100亿倍。 这就是试除次数随输入位数的指数增长:位数出现在指数上。
为了感受这个速度,假设一台机器每秒能完成10亿次试除,即 \(10^9\) 次。暂且让每次试除都一样快,只估算一路检查到待分解整数的平方根附近需要多久:
| 待分解整数的十进制位数 | 试除次数的估算尺度 | 按每秒10亿次折算 |
|---|---|---|
| 20位 | \(10^{10}\) | 约10秒 |
| 40位 | \(10^{20}\) | 约3200年 |
| 80位 | \(10^{40}\) | 约 \(3\times10^{23}\) 年 |
这种试除法的困难在于:输入位数增加时,尝试次数按指数增长。 要处理更大的整数,除了加快机器,还要寻找增长更慢的算法。
整数分解算法:从经典方法到Shor算法
计算机科学家发展出了远比逐个试除有效的方法。2020年,研究团队用数域筛算法完成了上面RSA-250的分解。团队报告的总计算量约为2700核年,以2.1 GHz的Intel Xeon Gold 6130处理器为参照。“核年”把各处理器核心的工作时间累加:多个核心并行分担了这项计算。一个250位整数的分解,成为需要算法、软件和大型计算资源共同完成的研究项目 [2]。
数域筛省下了大量计算,但输入越长,计算量仍会急剧增加。其标准估计属于亚指数增长:增长速度低于试除法这样的指数函数,却仍超过位数的任意固定次幂。如果能把工作量控制在位数的平方、立方等固定次幂之内,就称为多项式时间算法。对于一般整数分解,这样的经典算法是否存在,仍是开放问题。
1994年,数学家彼得·肖尔(Peter Shor)给出了一条量子路线:在理想量子计算模型中,整数分解可以用随输入位数按多项式规模增长的资源完成 [24]。例如,若工作量正比于位数的三次方,位数翻倍时工作量只乘以8;刚才的试除模型从20位增至40位,工作量却乘以100亿。这里用三次方展示增长方式,具体算法的资源计数还取决于实现。
可以把三种增长规律画在同一张图上。横轴沿用整数的十进制位数;为了比较增加位数带来的变化,每条曲线都把20位时的工作量单独设为1。
读图时注意纵轴:从1到 \(10^{10}\),与从 \(10^{10}\) 到 \(10^{20}\),在图上跨过同样的高度,却都是再乘100亿。对数刻度把巨大的数量级差异放进了同一幅图。红线在这种刻度下仍一路上升,蓝线则缓慢抬高。
图中的蓝线说明Shor算法所属的多项式增长类型;数域筛曲线保留标准估计中的主项。每条线都从自己的20位工作量起算,因此图比较的是输入变长以后,各自的工作量增长多少倍。实际耗时还需要具体电路、经典算法实现和硬件参数。
将十进制位数记为 \(d\),基准取 \(d_0=20\)。试除和三次多项式示例的相对工作量分别为
\[R_{\mathrm{trial}}(d)=10^{(d-d_0)/2},\qquad R_{\mathrm{poly}}(d)=\left(\frac{d}{d_0}\right)^3.\]
数域筛的标准启发式估计主项为
\[F(N)=\exp\!\left[c(\ln N)^{1/3}(\ln\ln N)^{2/3}\right],\qquad c=\left(\frac{64}{9}\right)^{1/3}.\]
这里 \(\ln\) 是自然对数,\(\exp(x)=e^x\)。取代表性尺度 \(N=10^d\),图中画的是 \(F(10^d)/F(10^{20})\),省略了渐近修正和实现中的常数。这一经典增长规律与Shor的多项式复杂度比较,可参看原论文第5节 [24]。
RSA破解的时间尺度:要算多少年?
RSA公钥里包含一个大整数:把它的两个素因子找出来,就能进一步算出私钥。这里考察的攻击路线,就是分解这个整数。前面的RSA-250有250位十进制数字;RSA-2048中的“2048”指二进制位数,写成十进制约有617位。
以2020年RSA-250的实测总计算量为起点,保持参考核心性能不变,按数域筛的增长公式作一次数量级外推:
| 待分解的RSA整数 | 参考单核的等效计算时间 | 数字的依据 |
|---|---|---|
| RSA-250:250位十进制数 | 约2700年 | 团队报告的实测总计算量 |
| 1024位RSA:约309位十进制数 | 约50万年 | 本讲按数域筛主项外推 |
| 2048位RSA:约617位十进制数 | 约600万亿年 | 同一模型外推 |
“单核等效时间”把所有核心的工作累加到一个参考核心上,RSA-250实际由许多核心共同完成 [2]。按这个粗略模型,即使让100万个同等核心同时开工,并假设工作能完全平分,分解一个2048位RSA整数仍约需6亿年。 这个数字展示固定算法与算力条件下的时间尺度;它会随算法、硬件和估算模型改变。
量子路线给出了另一种时间尺度:一项2025年的资源估算提出,在指定的纠错与硬件条件下,使用少于100万个物理量子比特——实际承担量子信息的可控物理单元——可在不到一周内分解2048位RSA整数。这是对具备这些条件的量子计算机的设计估算,尚非一次已完成的破解实验 [8]。
经典一侧沿用上面数域筛的主项 \(F(N)\),把RSA-250的具体整数记为 \(N_0\),以报告的2700核年作标定:
\[T(N)\approx2700\frac{F(N)}{F(N_0)}\quad\text{核年}.\]
对 \(b\) 位二进制整数,取代表性尺度 \(N\approx2^b\)。代入 \(b=1024\) 和 \(b=2048\),分别得到约 \(5\times10^5\) 和 \(6\times10^{14}\) 核年。再把后者除以 \(10^6\) 个核心,得到约 \(6\times10^8\) 年。这一步假设理想并行;真实任务还受内存、通信和不同阶段并行能力的约束。
这是一项教学用外推,忽略渐近修正及软件、硬件变化,不能作为攻击耗时的精确预测或数学下界。
量子一侧采用克雷格·吉德尼(Craig Gidney)2025年论文的资源估算。论文设定最近邻连接的二维量子比特网格、0.1%的物理门错误率、1微秒的表面码纠错周期和10微秒的控制系统响应时间,计入纠错等资源开销,得到少于100万个物理量子比特、不到一周的估计 [8]。物理量子比特与CPU核心是两种不同资源;这里比较的是各自所列条件下完成同一分解任务的时间。
我们会在本讲结尾回到21,看看Shor算法怎样从周期中提取因子。
Shor算法表明,计算采用的物理模型会影响解决同一任务所需的资源。 这就是本讲要追踪的悬念——量子规律究竟提供了什么新能力?
整数分解与乘法验证:找到答案和检查答案
前面已经比较了21、221与RSA-250,并给出了试除增长的选读估算。现在保留其中最重要的区别:拿到两个因子后,乘回去检查容易;只给乘积时,还需要一种方法找到因子。RSA把这种计算上的不对称用于密钥构造。
用二进制位数 \(n\) 表示同一个增长规律时,一个 \(n\) 位整数约为 \(2^n\),所以同一个试除估算写成 \(2^{n/2}\);开场使用十进制位数 \(d\),则写成 \(10^{d/2}\)。两者描述的是同一种增长行为。2048位RSA模数中的“位”指二进制位,约相当于617位十进制数字。
RSA的数论结构:素数、模幂与密钥
RSA密钥生成的一部分,是选择两个大素数 \(p,q\),构造
\[N=pq.\]
公钥包括模数 \(N\) 和一个公开指数。私钥指数的求法则利用了 \(p,q\) 所确定的数论量。因此,如果能够高效分解公开的 \(N\),就能据此恢复相关私钥信息。这就是整数分解会威胁RSA安全基础的原因。
对两个不同素数的乘积 \(N=pq\),定义
\[\varphi(N)=(p-1)(q-1).\]
它数的是从0到 \(N-1\) 的整数中,有多少个与 \(N\) 没有大于1的公因数。可以从总数中排除 \(p\) 的倍数、\(q\) 的倍数,再把重复排除的0加回来,得到 \(pq-q-p+1\)。
一种标准的RSA构造选择与 \(\varphi(N)\) 互素的公开指数 \(e_{\mathrm{pub}}\),再寻找私钥指数 \(d\),使
\[e_{\mathrm{pub}}d\equiv1\pmod{\varphi(N)}.\]
这里的同余符号表示:两边相减,能被模数整除。换句话说,\(e_{\mathrm{pub}}d\) 除以 \(\varphi(N)\) 余1。这个求逆问题可以用高效的经典整数算法完成。因而攻击者一旦知道 \(p,q\),就得到 \(\varphi(N)\),进而计算一个有效的私钥指数。实际密钥构造也可使用相应的最小公倍数形式。
我们现在有了明确任务:在给定公开整数时寻找它的因子。Shor方法的关键一步,是把它联系到另一个任务——寻找模运算中的周期 [14, 24]。
要理解这种新能力,需要先认识量子理论怎样描述光和物质。我们从它的实验起点进入:加热物体怎样发光,光怎样把能量交给电子,原子又为什么只发出某些颜色。这三个问题先引出能量的量子化;随后,电子干涉会把我们带到算法所用的概率幅与相位。
1.2 量子力学:从实验困难到叠加与纠缠
先把时间拨回20世纪初。经典力学用位置、速度和作用力描述运动,电磁理论用电场和磁场解释光的传播。这些理论在行星运动、机械装置、光学和电路中取得了很大成功。但光与物质怎样交换能量、电子怎样组成稳定的原子,还留下了几个难题。我们从三种可以测量的现象看起。
黑体辐射:加热的物体,为什么发出这样的光?
逐渐加热灯泡里的金属丝,观察它刚开始发光时的颜色,再看亮起来以后颜色怎样变化。这是物体因温度而发出电磁辐射的现象,称为热辐射。灯丝让我们先记住一个直观现象:
灯丝越热越亮,发光颜色由暗红逐渐转向橙红、黄白。
回看课堂中的灯丝加热实验。 注意分光后的图样:灯丝发出的光展开成连续的彩带,同时包含许多波长。
来源:BYU Physics Demonstrations,Blackbody radiation。原视频完整保存在本地,与课堂课件一致。
要把发光的变化测清楚,可以把辐射按波长分开,在每个窄波段测量功率,然后画出光谱。不过,真实物体的热辐射还与材料及表面状况有关。为了研究一个不依赖具体材料的共同基准,物理学引入了黑体这个理想模型。
黑体的定义是:对所有波长、所有入射方向的电磁辐射都完全吸收,既不反射,也不透射。 热平衡理论进一步表明,黑体在给定温度下的单位面积热辐射光谱具有普遍形式,与材料无关。因此,对黑体谱而言,确定温度就确定了整条曲线 [22]。
灯丝能够反射一部分入射光,并不满足完全吸收的条件,所以金属灯丝是热辐射的演示对象,不能直接当作理想黑体。它发出的连续光谱和随温度改变的颜色,为我们认识热辐射提供了直观入口;定量预测灯丝的光谱还要考虑材料的发射率,也就是它相对于同温度黑体的发射能力。
下面用黑体模型,把温度、光谱和颜色连起来。 升温时,黑体的总辐射增强,谱峰向短波方向移动,可见光中蓝光相对于红光的比例增大。整体发光由偏红转向白色,温度更高时呈蓝白色;眼睛看到的是许多波长叠加后的颜色。
在模拟中把温度依次调到约2000 K、3000 K和6000 K,观察黑体光谱曲线与光源颜色的变化。
- 找到每条曲线最高的位置。升温后,峰值向长波还是短波移动?
- 看可见光波段内的辐射怎样变化,再比较光源的颜色。需要时调整坐标轴范围;比较辐射强弱时,要同时读纵轴刻度。
- 降低温度,直到光源几乎不发可见光。此时红外波段还有辐射吗?
单独打开/放大黑体光谱模拟。来源:PhET Interactive Simulations,University of Colorado Boulder。模拟中的曲线由黑体辐射理论计算;下面再看实验光谱与理论的比较。模拟随讲义保存在本地。
实验中怎样实现接近黑体的辐射源? 常用的方法是制作一个带小孔的热空腔,把小孔作为吸收和发射辐射的开口。进入小孔的光在腔内多次反射,容易被腔壁吸收;当腔壁保持均匀、稳定的温度时,小孔向外发出的辐射就能很好地逼近黑体谱。测量时让这束光经过分光装置,用探测器逐个波段记录信号。下图说明空腔为何能成为良好的吸收体 [22]。
测出了各个波段的辐射强度,接下来就要问:给定温度,能否用一个公式算出整条光谱? 先看维恩辐射公式和瑞利–金斯公式给出的答案。
一条是维恩(Wilhelm Wien)提出的维恩辐射公式。它曾很好地符合短波测量,但延伸到长波后会低估辐射。另一条是瑞利–金斯公式,以瑞利(Lord Rayleigh)和金斯(James Jeans)命名。它从经典电磁学和热平衡下的能量分配出发计算辐射,在足够长的波长处有效,却在短波处预言过强的辐射。
下面用教材图比较实验与理论。圆点表示实验曲线,维恩曲线和瑞利–金斯曲线分别在图中标出;图中还给出了稍后要介绍的普朗克曲线。横轴是波长,向左是短波、高频,向右是长波、低频;纵轴表示单位波长的辐射强度。
沿着实验点从左往右看,辐射先增强,达到峰值后再逐渐减弱。峰的两侧都下降,整个谱给出有限的总辐射功率。这就是理论需要解释的实验规律。
维恩曲线在短波一侧贴近实验点,到了长波一侧便偏低。瑞利–金斯曲线在长波一侧逐渐接近实验,向短波方向却急剧上升,错过了谱峰和峰左侧的下降。
这两条公式各自在一个波长范围内有效。完整的辐射规律还要解释峰值,并同时符合短波和长波的测量。
瑞利–金斯公式在短波端的失败尤其严重:按它把所有波长的辐射功率加起来,总功率竟会无限增大。这与实验中有限的辐射功率矛盾,后来被称为“紫外灾难”。仅靠这套经典计算,无法得到正确的完整光谱。
马克斯·普朗克(Max Planck)在1900年找到了一条与整个实验光谱相符的公式,也就是图中贴近实验点的普朗克曲线。它用同一个表达式统一了短波端和长波端的有效规律,也给出了中间的谱峰。 为了理解这条公式的物理来源,他在物质振子与辐射的能量统计中引入能量元
\[\varepsilon=h\nu.\]
这里 \(\nu\) 是频率,\(h\) 是普朗克常数,数值为 \(6.62607015\times10^{-34}\ \mathrm{J\,s}\)。频率的单位是每秒,所以 \(h\nu\) 的单位是焦耳,即能量单位。以离散能量元进行统计,得到与黑体实验相符的分布,使能量交换的离散性成为一条值得继续追踪的物理线索 [16, 22]。
黑体辐射把“能量可以任意连续分配”的经典想法推到了极限。 普朗克按能量元进行统计,算出了完整光谱。量子的故事由此有了第一个具体内容:描述能量交换时,需要引入离散的单位。
先用误差说明“有效”的含义。以2000 K的Planck公式为基准计算:在1.5 μm处,Wien公式只偏低约0.8%;在6 μm处,Rayleigh–Jeans公式仍偏高约93%,直到约75 μm处才缩小到5%左右。这些数值由三条理论公式计算。
为定量比较近似的有效范围,这里另取温度2000 K,按公式计算三种理论,并把波段延伸到200 μm。上图的三条曲线统一除以同一个Planck谱峰值;下图将两种近似分别除以Planck公式,等于1表示吻合,浅色区域标出相对误差不超过5%的范围。
把每单位波长的谱辐亮度记作 \(B_\lambda\)。它描述单位投影发射面积、单位立体角内,每个小波长区间所携带的辐射功率。三条公式为
\[B_\lambda^{\mathrm P}(T)=\frac{2hc^2}{\lambda^5}\frac{1}{e^{hc/(\lambda k_{\mathrm B}T)}-1},\]
\[B_\lambda^{\mathrm{RJ}}(T)=\frac{2ck_{\mathrm B}T}{\lambda^4},\]
\[B_\lambda^{\mathrm W}(T)=\frac{2hc^2}{\lambda^5}e^{-hc/(\lambda k_{\mathrm B}T)}.\]
其中 \(\lambda\) 是波长,\(c\) 是真空光速,\(T\) 是绝对温度,\(k_{\mathrm B}\) 是玻尔兹曼常数;\(k_{\mathrm B}T\) 给出温度对应的能量尺度。记
\[x=\frac{hc}{\lambda k_{\mathrm B}T}.\]
这是两个能量的比,没有单位。长波、低频处 \(x\ll1\),利用 \(e^x-1\approx x\),Planck公式化为Rayleigh–Jeans公式。短波、高频处 \(x\gg1\),利用 \(e^x-1\approx e^x\),Planck公式化为Wien公式。一个表达式因而把两端的有效近似连接起来。
当 \(\lambda\to0\) 时,Planck与Wien公式中的指数抑制超过逆幂增长,两者均趋于零;Rayleigh–Jeans公式却按 \(\lambda^{-4}\) 发散。Wien公式在长波处又低于Planck结果,两者之比为 \(1-e^{-x}\)。
两种近似相对于Planck公式的误差可以直接写成
\[\delta_{\mathrm W}=\frac{B_\lambda^{\mathrm P}-B_\lambda^{\mathrm W}}{B_\lambda^{\mathrm P}}=e^{-x},\qquad \delta_{\mathrm{RJ}}=\frac{B_\lambda^{\mathrm{RJ}}-B_\lambda^{\mathrm P}}{B_\lambda^{\mathrm P}}=\frac{e^x-1}{x}-1.\]
以5%为标准,在2000 K时,Wien近似适用于约2.4 μm以下,Rayleigh–Jeans近似适用于约74 μm以上。长波端三条曲线的绝对值都趋近零,在线性图上看似靠拢;比较它们的比值,才能判断近似是否准确。这些波长界限会随温度升高而按反比缩短。
教材定义的 \(I(\lambda,T)\) 是积分出射方向后的每单位面积、每单位波长辐射功率。理想黑体有 \(I(\lambda,T)=\pi B_\lambda(T)\),所以归一化后的形状相同。若改用“每单位频率”的谱,则须用 \(B_\nu|d\nu|=B_\lambda|d\lambda|\) 换算。
光电效应:光的颜色,怎样决定电子的能量?
普朗克在热辐射的能量统计中引入了离散单位。这个线索还能解释另一类实验吗?现在让光照到金属上,看看它怎样把能量交给电子。光照可以使电子从金属表面逸出,这就是光电效应。先看一个用验电器就能观察到的实验:让锌板带上负电,验电器的指针偏转;如果电子从锌板逸出,负电荷减少,指针就会回落。
强可见光和紫外光,哪一种能让它放电? 视频依次展示两种照明条件。注意指针的变化:强可见光照射时,锌板没有明显放电;换成紫外光后,指针回落。
验电器让我们看见电子是否逸出,但还不能分别测清逸出电子的数量和能量。为此,下面的模拟改用两块金属极板:光照第一块板,使电子逸出;第二块板收集电子,电流反映单位时间收集到的电子数量。再施加阻碍电子前进的反向电压,就可以检查它们有多大的动能。这样才能分别比较:改变光强与改变频率,各自改变了什么?
电子离开金属需要一定能量,最低所需的能量叫作材料的逸出功。界面用电子伏特(eV)表示能量,\(1\ \mathrm{eV}=1.602176634\times10^{-19}\ \mathrm J\)。
亲手试三步。 先将模拟复位,保持默认逸出功2.9 eV、电压0 V。界面中的“select λ”选择波长,“select Intensity”选择光强;波长越短,频率越高。
- 先用红光,再增加光强。 选择Red(700 nm),把光强从30%调到100%。观察电子是否逸出,电流是否出现。
- 保持光强,换成紫光。 选择Violet(400 nm)。此时是否出现逸出的电子和电流?
- 固定紫光,改变光强。 在30%和70%之间切换,比较单位时间内逸出的电子数量和电流。再选择“world and I vs V”查看电流随电压的曲线,比较不同光强下使电流降到零所需的反向电压。
来源:OSP Singapore;作者署名。单独打开/放大模拟。 PhET备选演示:独立窗口(英文,需联网)。
反向电压让逸出的电子减速。电流刚降到零时,连动能最大的电子也到不了另一块极板;这个电压的大小叫作遏止电压,因此它能告诉我们电子的最大动能。固定频率增加光强,电流增大,遏止电压却不变。
对固定材料,能发生光电效应的最低光频率叫作阈频。把刚才分别改变颜色和亮度的结果归纳为一句话:对同一种金属,频率决定能否打出电子及其最大动能;超过阈频后,固定频率提高光强,主要增加逸出电子的数量。
阿尔伯特·爱因斯坦(Albert Einstein)在1905年用光量子来理解能量交换。一个频率为 \(\nu\) 的光子携带能量 \(h\nu\)。电子从金属中逸出,需要克服材料的逸出功 \(W\);对具有最大逸出动能的电子,能量守恒给出
\[h\nu=W+K_{\max}.\]
当光子能量低于 \(W\) 时,这个单光子过程无法提供足够能量。阈频因此是 \(\nu_0=W/h\)。超过阈频后,频率越高,剩余给电子的动能越大 [23]。
可以算一个小例子。电子伏特eV是常用的微观能量单位,\(1\ \mathrm{eV}=1.602176634\times10^{-19}\ \mathrm J\)。光子的能量也可以用波长表示:
\[E=\frac{hc}{\lambda},\qquad hc\approx1240\ \mathrm{eV\,nm}.\]
对波长500 nm的光,光子能量约为 \(1240/500=2.48\ \mathrm{eV}\)。如果金属的逸出功为2 eV,电子的最大动能约为0.48 eV。把同样波长的光变得更亮,会增加入射光子数;每个光子的能量仍是2.48 eV。频率和强度在实验中承担了不同的角色。
光电效应把量子观念推进到光本身:光能以一个个光量子的形式把能量交给电子,每份能量为 \(h\nu\)。 频率决定每份能量;固定频率时,增强光强意味着增加光量子的数量。接下来,原子发出的特定颜色将告诉我们:物质内部的能量也有离散结构。
原子能级与线状光谱:原子为什么只发出某些颜色?
前面加热灯丝时,我们看到了一段连续的光谱。现在换一支低压气体放电管:通电后,气体也会发光,但用光栅把这些光按波长分开,会看到一条条分立的亮线。换一种气体,亮线的位置和组合也随之改变。
直接比较谱线的位置与组合。 下面按同一波长标尺排列连续光谱和氢、氦、汞的代表性谱线,与课堂使用的图一致。连续光谱铺开为色带;原子光谱集中在特定波长,不同元素的组合不同。
先记住这个现象:受激发的稀薄原子气体发出分立的谱线,光集中在一些特定波长上。 谱线的位置与元素种类有关,因此光谱也能帮助我们识别发光物质。
光电效应已经把光的频率与单个光子的能量联系起来:每个光子携带能量 \(h\nu\)。因此,这些固定的谱线提出了一个更具体的问题:原子为什么只以某些特定的能量发出光子? 如果把原子画成电子绕核运转的小太阳系,电子在弯曲轨道上持续加速,按经典电磁学会不断辐射、损失能量,轨道也随之改变。这个模型既面临原子稳定性的困难,也没有给出固定的谱线。我们需要能同时解释稳定原子和分立光谱的规则。
尼尔斯·玻尔(Niels Bohr)在1913年用允许的离散能量状态与跃迁规则描述氢原子。能级是系统可能具有的能量值。原子从较高能级转到较低能级,这个过程称为跃迁;跃迁时,能量差可交给一个光子:
\[E_{\mathrm{高}}-E_{\mathrm{低}}=h\nu.\]
再用交互模型,把一条谱线和一次跃迁对应起来。 下面是PhET的“氢原子模型”。进入“能级”页面,先使用“玻尔”模型:
- 点击左侧光源的红色开关,使用“白色”光源;点击“光谱仪”旁的加号,展开光子计数图。
- 选择“慢速”,对照左侧原子动画与右侧电子能级图。观察电子吸收光子后能级升高、发射光子后能级降低的过程;需要时暂停或单步前进。
- 等待光谱仪累积记录。计数会集中在哪些波长?点击“跃迁”查看波长与能级对的对应,找到656 nm与第3、第2能级的关系。随后可切换“薛定谔”模型,比较原子的表示方式与谱线位置。
单独打开/放大氢原子模型。来源:PhET Interactive Simulations,University of Colorado Boulder。模拟通过入射光激发原子,前面的实拍光谱通过气体放电激发原子;两者都让我们观察激发后的发光。动画展示所选模型,界面中的“实验”模式也是模拟呈现。模拟随讲义保存在本地。
模拟中的谱线现在有了能量上的解释:每个发射光子的能量,等于原子下降的那两个能级之差。
例如,氢原子从第3能级跃迁到第2能级,发出的光波长约为656 nm,对应刚才看到的红色谱线。其他几个跃迁到第2能级的过程产生约486 nm、434 nm和410 nm的谱线,属于Balmer线系。
在氢原子的近似模型中,束缚能级为
\[E_n\approx-\frac{13.6\ \mathrm{eV}}{n^2},\qquad n=1,2,3,\ldots.\]
能量零点取在电子和质子相距无穷远、相对静止的状态,所以束缚态能量为负。\(n\) 越大,能量越靠近零;从高 \(n\) 向低 \(n\) 跃迁释放能量。以 \(n=3\) 到 \(n=2\) 为例:
\[\Delta E\approx13.6\left(\frac14-\frac19\right)\mathrm{eV}\approx1.89\ \mathrm{eV},\]
\[\lambda\approx\frac{1240\ \mathrm{eV\,nm}}{1.89\ \mathrm{eV}}\approx656\ \mathrm{nm}.\]
这对应可见光中的红色谱线,也就是模拟“跃迁”表中的656 nm。其他从更高能级跃迁到 \(n=2\) 的可见谱线,位于约486 nm、434 nm和410 nm。这些跃迁属于Balmer线系。由此,刚才看到的“几条颜色”就与原子内部的能级差联系起来了。
下图汇总四条可见谱线的模型波长,供计算后核对。
原子光谱把量子观念从光带进了物质内部:原子的束缚能级是离散的,谱线记录的是能级之间的差。 光量子与原子能级由能量守恒联系起来;我们还需要解释,电子为何只能形成这些状态。
玻尔模型把允许的电子轨道作为额外条件加进来,算出了氢原子的能级。要解释这些条件从何而来,就得重新审视原子中的电子:电子是否具有“小球绕核运动”这幅图像没有包含的性质? 物质波假说为这个问题提供了一条探索路线。
物质波:让电子也参与干涉
光提供了一个启发:它在干涉和衍射中表现出波动性,在光电效应中又以一份份能量与电子交换能量。那么,一向被当作粒子的电子,会不会也具有波动性?路易·德布罗意(Louis de Broglie)在1924年提出物质波假说:物质粒子也有波动性,动量 \(p\) 对应波长
\[\lambda=\frac hp.\]
这里 \(p\) 是动量的大小。动量越大,波长越短。
波动性为什么可能帮助解释离散能级?想想两端固定的琴弦:只有满足两端约束的振动模式能够形成驻波,因此有一组分立的固有频率。这提供了一条思路:原子中允许的电子状态,也可能由波所满足的条件来决定。后来的量子力学沿着这条思路,用波动方程求出氢原子的束缚态和离散能级。
不过,电子究竟有没有波动性,需要电子实验来回答;已有的光学干涉不能代替这项验证。如果电子也能产生干涉条纹,物质波就有了直接的实验证据。 实验者可以通过加速电压调节电子的动量,再让电子通过能使两路电子波重叠的装置,观察它们在屏幕上留下什么。
这里 \(p\) 是动量的大小。对远低于光速的电子,可以用 \(p\approx m_e v\);更一般的情形使用相对论动量。动量越大,波长越短。如果电子被加速电压 \(U\) 从近似静止状态加速,并处于非相对论范围,动能 \(p^2/(2m_e)=eU\),于是
\[\lambda\approx\frac{h}{\sqrt{2m_e eU}}.\]
这说明电子波长可以由实验条件控制。以150 V为例,波长约为0.10 nm,已经与原子间距处于相近尺度。晶体因而可以成为检验电子波动性的衍射结构。这里的电压只是一个波长估算例子,后面电子双棱镜实验有自己的装置参数 [3]。
德布罗意、薛定谔和海森堡代表了相互衔接的进展:提出物质波假说,再发展描述量子状态和演化的计算形式。学习这些理论,可以先抓住它们必须回答的实验问题:让电子波沿两个通道传播,再使它们重叠,探测屏上会留下怎样的图样?
物质波让量子故事从能量的离散性,走向微观运动的波动性。 早期电子衍射已经验证物质波;下面先理清实验年代,再用单电子逐点累积观察单次记录与统计分布。
实验证据:先有电子衍射,再看单电子累积
1924年的物质波假说把波长与粒子动量联系起来。1927年,克林顿·戴维孙(Clinton Davisson)与莱斯特·革末(Lester Germer)的晶体散射实验,以及乔治·佩吉特·汤姆孙(George Paget Thomson)等人的薄膜透射实验,获得了电子衍射证据。这些实验检验的是电子的波动性。
路易·德布罗意(Louis de Broglie)于1929年获诺贝尔物理学奖;戴维孙与汤姆孙于1937年因电子衍射实验获奖。工作年代与获奖年代需要分开。更晚的单电子实验追问的是:电子逐个通过时,局域探测记录怎样积累成干涉分布?课堂采用外村彰团队1989年的结果,是为了看清这个问题,而不是将它作为物质波最早的验证。
单电子干涉:一个个电子怎样形成条纹?
在波动光学中,我们已经见过两路光叠加形成的明暗条纹。现在把实验对象换成电子:不仅要看电子束能否形成条纹,还要把电子一个个送入装置,观察单次落点与累积图样之间的关系。
电子双棱镜:电子经过怎样的干涉装置?
外村彰(Akira Tonomura)团队在电子显微镜中实现了这一实验。电子源发出电子,电场将它们加速;电子波经过双棱镜后,两部分在下游重叠;探测器将每次到达转换成可以记录的位置。下图是日立研究团队提供的装置示意。实验介绍
图中的电子双棱镜由中央的细丝和两侧电极组成。细丝与两侧电极之间的电势差,使经过细丝两侧的电子波向中间偏转,随后在探测器所在区域重叠。这里的两个通道,就是细丝两侧的空间区域。
这里仍需要波动光学中熟悉的相干条件:两部分波在测量过程中保持稳定的相位关系。双棱镜将同一束电子波分成两路并使它们重新重叠,功能上对应光学干涉装置中的分束与合束。
这套装置还需要一项能力:分辨单次电子事件。探测器把一次电子到达所产生的信号放大,并登记位置;显示屏上的一个亮点就代表这样一条记录。
这套装置把“电子有波动性”变成了可检验的问题:让两路电子波重叠,再逐个记录电子的落点。 它既能观察干涉,又能分辨单次事件,因而可以追问条纹是否需要许多电子同时出现。
逐点累积实验:一次一个电子,还会有条纹吗?
看到电子束形成条纹,还需要排除一种可能的解释:条纹会不会是许多电子彼此相互作用的结果? 电子带有电荷,彼此之间存在库仑作用。如果许多电子同时穿过装置,仅凭最后的条纹,还不能判断这种相互作用是否参与了条纹的形成。
为了检验这个解释,我们减弱电子束,让相邻电子之间的时间间隔远大于穿过装置所需的时间,使电子几乎总是彼此分开地通过。如果在这样的条件下仍然出现条纹,就说明条纹的形成不需要不同电子同时在场、彼此相互作用。 因此,实验既要确认电子之间隔得足够开,又要观察大量单次记录累积后是否仍有条纹。
日立的实验介绍给出了这样的量级:每秒约发出10个电子,一个电子穿过显微镜约需 \(10^{-8}\) 秒。相邻电子的平均间隔约为
\[ \frac{1}{10\ \mathrm{s}^{-1}}=0.1\ \mathrm{s}. \]
平均间隔比穿越时间长约一千万倍。按“到达速率乘停留时间”估算,装置内的平均电子数约为
\[ (10\ \mathrm{s}^{-1})(10^{-8}\ \mathrm{s})=10^{-7}. \]
电子几乎总是彼此分开地穿过装置。探测器仍然不断留下记录,而累积的记录仍然形成了条纹。实验条件与观察过程
先看最上面一幅。仅凭这几个点,很难猜出最后的图样。再向下看,某些位置的记录越来越密,另一些位置始终比较稀疏。到最下面,条纹已经清楚地显现出来。
电子彼此分开地通过,仍然能累积出干涉条纹,说明不同电子之间的相互作用并非形成条纹的必要条件。 现在需要解释的是:单个电子每次只留下一个局部落点,为什么许多次独立记录却组成了有明暗规律的分布?这就把问题引向单电子的探测概率。
动画回顾:双缝中的单次事件与整体分布
课堂动画用小球、水波和电子作对照。观看时抓住两个观察:一次电子探测是局域事件;许多次相同制备的落点却可以形成干涉条纹。“波粒二象性”概括这种现象,并不是在状态、演化、测量规则之外再加一条独立的计算公设。动画中的“观察”应理解为物理装置取得了可区分的路径记录,不需要人的意识参与。
教师原PPT第10页嵌入视频的完整本地副本,保留原片画面和音轨。动画是教学示意;逐点累积的实验证据见上方外村彰团队图像。
量子力学的基本描述:状态、演化与测量
单电子实验留下了两个需要同时解释的事实:每次探测得到一个局部结果,重复实验却呈现稳定的干涉分布。量子力学的任务是从制备条件出发,预测系统怎样变化,以及各种测量结果出现的概率。
薛定谔方程:状态怎样随时间变化?
埃尔温·薛定谔(Erwin Schrödinger)在1926年建立波动力学。对于这里讨论的非相对论、封闭系统,波函数随时间的变化由薛定谔方程描述:
\[i\hbar\frac{\partial\psi}{\partial t}=\hat H\psi.\]
\(\psi\) 是波函数,\(t\) 是时间,\(i\) 是虚数单位,\(\hbar=h/(2\pi)\);\(\hat H\) 是哈密顿算符,包含系统的能量及相互作用。给定初始状态和哈密顿量,就能计算状态怎样演化。 如果改变粒子经过的势场,就改变了演化条件;后面控制相位和量子操作的物理入口就在这里。本讲先认识方程回答的问题,具体求解放到后续动力学课程。
维尔纳·海森堡(Werner Heisenberg)在1925年发展的矩阵力学提供了另一种表述。波动力学与矩阵力学共同进入统一的量子理论;不能将波函数的图像误当成电子沿某条经典轨道运动的录像。
玻恩规则:波函数怎样联系探测结果?
马克斯·玻恩(Max Born)在1926年提出概率解释。以一维位置测量为例,归一化波函数给出概率密度
\[\rho(x,t)=|\psi(x,t)|^2,\qquad \int_{-\infty}^{\infty}|\psi(x,t)|^2\,\mathrm dx=1.\]
落在区间 \([x_1,x_2]\) 的概率是该区间下的面积:
\[P(x_1\leq x\leq x_2)=\int_{x_1}^{x_2}|\psi(x,t)|^2\,\mathrm dx.\]
一次测量得到一个位置;对同样的状态反复制备、测量,计数直方图才逐渐接近理论分布。
因此,薛定谔方程预测的是状态的演化,玻恩规则将状态联系到结果的概率。它们共同解释为什么单次结果可以随机,而重复实验的统计仍有明确规律。
不确定性关系:同一量子态允许怎样的分布?
海森堡在1927年提出不确定性关系。对具有有限位置、动量方差的状态,位置和相应动量的标准差满足
\[\Delta x\,\Delta p\geq\frac{\hbar}{2}.\]
\(\Delta x\) 和 \(\Delta p\) 是同样制备的状态在位置测量、动量测量中各自的分布宽度。它们不是只由仪器不精确造成的误差,也不是同一个粒子同时被读出的两个经典属性。位置越集中,动量分布就不能任意窄;是否达到等号取决于具体量子态。
回收历史:从量子假设到统一理论
| 工作年代 | 核心进展 | 回答的问题 |
|---|---|---|
| 1900—1913 | 普朗克、爱因斯坦、玻尔提出量子假设 | 能量怎样交换,原子怎样保持稳定? |
| 1924 | 德布罗意提出物质波 | 物质粒子是否也有波动性? |
| 1925—1926 | 海森堡、薛定谔建立量子力学的演化描述 | 状态怎样随时间变化? |
| 1926—1927 | 玻恩概率解释与海森堡不确定性关系 | 状态怎样联系测量,分布受到什么约束? |
| 1927 | 电子衍射实验验证物质波 | 电子波长与动量的关系是否符合实验? |
上表将工作年代与贡献相联系;外村彰团队1989年的逐点累积展示是后来的实验发展。为了先看清问题,课堂先展示单电子记录,再回到1920年代建立的理论语言。
历史背景:更多量子力学的故事
| 《上帝掷骰子吗?》 | 《群星闪耀:量子物理史话》 | 《奥本海默》 |
|---|---|---|
![]() |
![]() |
![]() |
| 曹天元 | 张天蓉 | 电影,2023年 |
这些作品可作为了解人物与时代背景的课外阅读和观影材料。
书目与海报沿用教师课堂选择。清华大学出版社:《群星闪耀——量子物理史话》,张天蓉著,2021年,ISBN 9787302565048;其他封面与海报来自教师原课件。
叠加态:相干的两路贡献怎样改变结果?
单电子可以处于两条路径的相干叠加中。用 \(|u\rangle\)、\(|d\rangle\) 表示可区分、彼此正交的上路态和下路态,这样的状态写为
\[|\psi\rangle=\alpha|u\rangle+\beta|d\rangle,\qquad |\alpha|^2+|\beta|^2=1.\]
能用一个归一化态矢量描述的状态称为纯态。竖线和尖括号表示量子态矢量;\(\alpha\)、\(\beta\) 是复概率幅。它们不仅有大小,还包含相位。直接按路径测量,两个结果的概率是 \(|\alpha|^2\) 和 \(|\beta|^2\);重新合并两路后,相对相位还会影响输出分布。
叠加态与“每次随机选一路”是两种不同的制备。 对同样的入射事件数,比较下面两种方案。每一列测量都使用独立批次的相同制备,并非先测路径再合束。
| 制备方式 | 直接测路径 | 通过同一理想平衡合束器再测输出 |
|---|---|---|
| 同相相干叠加 \((|u\rangle+|d\rangle)/\sqrt2\) | 上、下各半 | 相位调好后,全从 \(D_0\) 输出 |
| 每次随机选上路或下路,各占一半 | 上、下各半 | \(D_0\)、\(D_1\) 各半 |
表中差别说明:同样的路径概率,不一定意味着同样的量子态。第二种制备称为概率混合:每次随机制备一个路径态,计算统计分布时对两种制备的概率作平均。它的整体统计不能用单个纯态矢量描述,称为混态。
约定平衡合束器的作用为
\[U|u\rangle=\frac{|D_0\rangle+|D_1\rangle}{\sqrt2},\qquad U|d\rangle=\frac{|D_0\rangle-|D_1\rangle}{\sqrt2}.\]
两列向量正交归一,因此这一作用保持总概率。对相干叠加,线性演化给出
\[U\frac{|u\rangle+|d\rangle}{\sqrt2}=|D_0\rangle.\]
对随机混合,分别制备任一路时,两输出都各半;再按各占一半作平均,\(P(D_0)=P(D_1)=1/2\)。比较的是同一装置下的相干相加与概率平均。
经典相干光也能在两路合束后表现出相长、相消。本节借它帮助理解相干性,不以“会干涉”作为量子计算优势的充分证据。接下来先算清电子探测的概率幅,再看测量怎样改变相干性;量子优势将在多比特与完整算法的层面讨论。
探测概率:从电子计数读出统计规律
玻恩规则给出理论概率;实验用重复探测的频率估计它。若共记录 \(N\) 个电子,其中 \(N_R\) 个落在探测区 \(R\),则
\[ f_R=\frac{N_R}{N} \]
是该次实验的频率估计。
在相同制备和探测条件下,有限样本的 \(f_R\) 会有统计波动;样本增多时,它趋近理论概率 \(P_R\)。
现在把屏幕划分为互不重叠、合起来覆盖全部记录的区域。每个电子只登记在其中一个区域,因此这些区域的概率之和为1。明条纹对应较高的局部探测概率,暗条纹对应较低的局部探测概率。
单电子条纹描述的是落点的概率分布。 计数告诉我们这个分布是什么样;理论还要说明,在给定装置和制备条件下,怎样把它算出来。
概率幅:从光强分布到电子的探测概率
前面用两路叠加态比较了合束后的输出。现在用多个可区分的离散输出模式表示探测结果,编号为 \(j\),计算相位怎样改变输出分布。这是屏幕条纹的简化模型;真实连续屏幕上,一个有限区域的概率要由该区域内的 \(|\psi(x)|^2\) 积分得到。
两路传播到同一个探测位置时,这种相位关系会影响该处的探测概率。计算可以借助波动光学中熟悉的形式:对于同频、同偏振的两路相干光,某处的电场复振幅分别为 \(\mathcal E_1\) 和 \(\mathcal E_2\),总振幅先相加,光强再由模平方给出:
\[I\propto\left|\mathcal E_1+\mathcal E_2\right|^2.\]
我们已经知道,相位相同会增强,相位相反可以相消;只把两路光强相加,不能得到干涉条纹。
在单电子问题中,量子理论为每个探测结果分配一个复数,称为概率幅;总概率幅记为 \(A\),相应的探测概率为
\[P=|A|^2.\]
这就是前面介绍的玻恩规则在离散输出模型中的形式。单电子态的相干叠加与Born规则共同给出干涉预测;它们是量子理论的物理规则,由实验检验,经典光学的相似公式帮助我们理解和计算 [6]。每次探测只留下一个局部记录,但这个落点的概率已经受两路相位影响。 重复相同的制备,许多记录便累积出条纹。
复数仍可用相量箭头表示:长度是模,方向是相位。后面沿用 \(e^{i\phi}\) 表示相位为 \(\phi\) 的单位相量;需要复习记号时,可以展开下面的数学工具框。
复概率幅可以写成
\[A=u+iv=r e^{i\phi},\qquad A^*=u-iv,\]
其中 \(A^*\) 是复共轭,\(r=|A|\),\(\phi\) 是相位。欧拉公式 \(e^{i\phi}=\cos\phi+i\sin\phi\) 把相位写成复平面上的方向。
\[|A|^2=A^*A=u^2+v^2.\]
取模平方给出概率;相加概率幅时,相位决定箭头怎样合成。下面的相量图用同向、垂直和反向三种情形展示这个区别。
概率幅叠加:两路贡献怎样相加?
在上述离散模型中,对于同一个输出 \(j\),把同一个电子沿两路传播所给出的概率幅贡献分别记作 \(a_j\) 和 \(b_j\)。在两路保持相干、没有可区分的路径记录时,总概率幅为
\[ A_j=a_j+b_j, \]
于是
\[ P_j=|a_j+b_j|^2. \]
展开便能看见两路相位起作用的地方:
\[P_j=|a_j|^2+|b_j|^2+2\operatorname{Re}(a_j^*b_j).\]
星号表示复共轭,\(\operatorname{Re}\) 表示取实部。最后一项是干涉项,来自同一个电子的两路概率幅。它可以增加或减少该处的探测概率;下面用相量图算出具体数值。
“先叠加振幅,再取模平方”的规则在这里给出电子的探测概率。 下面沿用光学中的相量图,把相长与相消换算成具体的计数预期。规则出处
相长与相消干涉:相位差怎样改变概率?
用一个简短算例熟悉概率的读法。固定屏幕上的一个小区域,让两路对它的概率幅长度都为 \(1/4\)。相量相加与波动光学相同,这次把计算结果读作电子落入该区域的概率:
| 两路箭头的关系 | 合成后的探测概率 |
|---|---|
| 同向:相长干涉 | \(\lvert1/4+1/4\rvert^2=1/4\),即25% |
| 垂直:相差四分之一圈 | \(1/8\),即12.5% |
| 反向:相消干涉 | \(\lvert1/4-1/4\rvert^2=0\) |
同向时贡献增强,反向时贡献抵消。下面的图把三种相加过程放在一起。
光学中相位改变光强分布;在这里,相位改变电子落点的概率分布。 本例中,相长时约四分之一的记录落在这个区域,完全相消时则没有记录落在这里。
先固定一个探测位置。在一个具体例子中,取两路概率幅的长度都为 \(1/4\),并把第一路的相位选为零:
\[ a=\frac14,\qquad b=\frac14 e^{i\phi}. \]
这里的 \(\phi\) 就是两路的相对相位。两路长度相等,表示它们对这个位置的贡献强度相同;相位差可以随传播条件改变。
相位相同
当 \(\phi=0\) 时,\(e^{i\phi}=1\),两根箭头同向:
\[ A=\frac14+\frac14=\frac12, \qquad P=\left|\frac12\right|^2=\frac14. \]
探测概率为25%。这种增强称为相长干涉。
相位相差四分之一圈
当 \(\phi=\pi/2\) 时,\(e^{i\phi}=i\)。第一根箭头沿横轴,第二根沿纵轴:
\[ A=\frac14+\frac{i}{4}. \]
用实部平方加虚部平方,得到
\[ P=\left(\frac14\right)^2+ \left(\frac14\right)^2=\frac18. \]
探测概率变为12.5%。
相位相差半圈
当 \(\phi=\pi\) 时,\(e^{i\phi}=-1\),两根等长箭头反向:
\[ A=\frac14-\frac14=0, \qquad P=0. \]
两路贡献在这个位置完全相消。这种情形称为相消干涉。
两路干涉公式:概率怎样随相位差变化?
用刚才的 \(a\) 和 \(b\),可以把任意相位下的结果一次算出:
\[ \begin{aligned} P(\phi) &=\left|\frac14+\frac14 e^{i\phi}\right|^2\\ &=\frac1{16}(1+e^{i\phi})(1+e^{-i\phi})\\ &=\frac1{16}\left(2+e^{i\phi}+e^{-i\phi}\right)\\ &=\frac18(1+\cos\phi). \end{aligned} \]
第二步用了复数的模平方规则:将一个复数与它的复共轭相乘。复共轭就是把虚部的符号反过来,所以 \(e^{i\phi}\) 的复共轭为 \(e^{-i\phi}\)。最后一步来自
\[ e^{i\phi}+e^{-i\phi}=2\cos\phi. \]
现在代入 \(0\)、\(\pi/2\) 和 \(\pi\),就能重新得到上面的三个结果。
对于一般的两路概率幅,同样的展开给出
\[ |a+b|^2=|a|^2+|b|^2+2\operatorname{Re}(a^*b). \]
星号表示复共轭,\(\operatorname{Re}\) 表示取实部。最后一项就是干涉项。在我们的例子里,它等于 \(\cos\phi/8\),随着相位改变而变正、变零或变负。
概率归一化:亮处增加的概率从哪里来?
刚才只算了一个探测区。若那里因相长干涉而更容易收到电子,其他地方会怎样?对覆盖全部可能落点的理想探测屏,每个电子总要落在某个区域,所有区域的概率之和必须为1,这称为概率归一化。要检查局部的相长与相消能否组成完整图样,就需要把整个屏幕一起计算。真实实验里,相对相位随位置变化,相长和相消出现在不同地方,于是形成明暗条纹。
干涉重新分配概率:亮处增加,暗处减少,总概率仍为1。 这样,局部的相长与相消才能组成一幅完整、可检验的探测图样。
只看一个探测位置,还会留下一个问题:如果相位让这里的概率增加了,全部位置的概率相加会怎样?我们可以把刚才的例子补成一个完整模型。
设一个理想装置有八个离散探测位置,编号为 \(j=0,1,\ldots,7\)。单独从任何一路输入时,电子到达这八个位置的概率都为 \(1/8\)。我们让两路以相等权重相干地参与,并设它们在相邻位置的相对相位增加 \(\pi/4\)。
在概率幅的计算中,连续两步过程的贡献相乘:先进入某一路,再从该路传播至探测位置。两路相等权重各对应一个幅度因子 \(1/\sqrt2\);单路到达某个位置的概率为 \(1/8\),对应的幅度长度为 \(1/\sqrt8\)。因此每路对该位置的贡献长度是
\[ \frac1{\sqrt2}\frac1{\sqrt8}=\frac14. \]
这就给出了前面选取 \(1/4\) 的一个完整来源。按顺序给八个位置分配相位:
\[ \phi_j=\frac{2\pi j}{8}. \]
于是每个位置的概率幅和概率为
\[ a_j=\frac14,\qquad b_j=\frac14 e^{i\phi_j}, \]
\[ P_j=\frac18(1+\cos\phi_j). \]
逐项代入即可得到下表。最后一列给出了记录1000个电子时的平均计数预期,取到最近的整数。
| 位置 \(j\) | 相位差 \(\phi_j\) | 探测概率 \(P_j\) | 1000次记录的平均计数,约 |
|---|---|---|---|
| 0 | \(0\) | 0.2500 | 250 |
| 1 | \(\pi/4\) | 0.2134 | 213 |
| 2 | \(\pi/2\) | 0.1250 | 125 |
| 3 | \(3\pi/4\) | 0.0366 | 37 |
| 4 | \(\pi\) | 0 | 0 |
| 5 | \(5\pi/4\) | 0.0366 | 37 |
| 6 | \(3\pi/2\) | 0.1250 | 125 |
| 7 | \(7\pi/4\) | 0.2134 | 213 |
总概率可以直接检查。在八个相位中,\(0\) 与 \(\pi\) 的余弦相消,\(\pi/4\) 与 \(5\pi/4\) 的余弦相消,其余也能两两配对。因此
\[ \sum_{j=0}^{7}\cos\phi_j=0, \]
从而
\[ \sum_{j=0}^{7}P_j =\frac18\left(8+\sum_{j=0}^{7}\cos\phi_j\right)=1. \]
相长位置增加的概率,由相消位置减少的概率补偿。干涉改变了记录在不同位置之间的分配。
我们还可以让第二路整体多获得一个相位 \(\delta\)。这时
\[ P_j(\delta)=\frac18\left[1+\cos\left(\frac{2\pi j}{8}+\delta\right)\right]. \]
下图比较了 \(\delta=0\) 和 \(\delta=\pi/2\)。各处的概率变化了,总和仍然为1。亮暗结构随着相位设置移动。
真实的电子干涉实验在许多位置记录事件。传播条件使相对相位随位置变化,于是相长与相消出现在不同地方,形成条纹;各路贡献的强弱还会决定图样整体的亮度分布。这个八位置模型让我们用一张表算清了其中的相位作用。
相干叠加与概率混合:两种制备的记录有何不同?
前面用两个输出口区分了叠加与混合。现在把同样的比较用于条纹:保持两条通道的传播条件不变,改为每次随机选择一路输入,各占一半,输出分布会怎样变化?
对这种概率混合,每个输出的总概率,是两种单路输入各自的探测概率取一半再相加,没有两路干涉项。相干制备还保留两路之间的相位关系,因而能产生不同的分布。同样,让相干制备的相对相位在多次试验间均匀随机变化,也会抹去累积图样中的稳定条纹。
再准备另一组实验。每次用随机选择的方式,只从第一路或第二路输入,二者各占一半。在八位置模型中,无论选哪一路,到达每个位置的条件概率都是 \(1/8\)。因此混合后的概率是
\[ P_j^{\mathrm{mix}} =\frac12\frac18+\frac12\frac18 =\frac18. \]
这里先按各路出现的比例加权,再相加概率。八个位置得到相同的平均计数,这就是@fig-l01-electron-eight 中的虚线。
相干制备则保留了两路之间的相位关系,给出
\[ P_j^{\mathrm{coh}}=\frac18(1+\cos\phi_j). \]
例如在位置0,相干制备给出 \(1/4\),概率混合给出 \(1/8\);在位置4,相干制备给出零,概率混合仍为 \(1/8\)。实验者可以通过重复准备和比较记录,分辨这两种情况。
也可以让两路同时参与,但让相对相位在每次试验之间随机变化。如果相位在一整圈中均匀分布,余弦的平均值为零。将不同试验的记录累积起来,同样会得到均匀的 \(1/8\)。观察稳定条纹,因此需要在积累数据的过程中保持足够稳定的相位关系。
保留相位的叠加,与随机选一路的混合,会给出不同的探测分布。 这说明量子态需要记录比“各有多大概率”更多的信息。要把这种差别用于计算,就必须保持并控制相位关系。
这个差别也提出了一个实验问题:对于原先的相干制备,如果在两路重叠之前加上路径探测器,能否一边记录电子走哪一路,一边保留原来的干涉条纹?要回答它,就必须把测量装置对电子状态的影响也算进去。
量子测量:从微观叠加到宏观记录
探测与退相干:路径记录怎样影响干涉?
原来的屏幕记录电子最终落在哪里。现在增加的路径探测器,要在两路重新重叠前,分别为“经过第一路”和“经过第二路”留下记录。记录需要电子与装置相互作用,电子的状态也因此与装置的状态关联起来。
有了路径记录,完整的结果就多了一个可区分的标签。 例如,同样落在位置 \(j\),还可以区分“路径记录为第一路”和“路径记录为第二路”。对这种完整可区分的记录,如果只统计落点而不区分路径标签,就要把两类结果的概率相加,原来的两路干涉项便消失。环境也可能携带部分或全部路径信息,使我们只观察电子时看到的干涉减弱或消失;这称为退相干。下面的折叠框用记录态的重叠程度计算干涉项怎样变化。
可区分的路径记录会削弱或消除电子的干涉。 要利用相位改变输出概率,就需要控制电子与装置、环境的相互作用,使两路贡献在重新合成时仍保持相干。
在理想投影测量模型中,如果两个结果的概率幅为 \(\alpha\)、\(\beta\),测到0的概率是 \(|\alpha|^2\)。一旦已经得到0,我们就用与结果0对应的状态继续预测后续试验;得到1时也一样。这个给定结果后的状态更新,常称为“坍缩”。它使“实验前预测”和“已知结果后的预测”有了各自明确的计算方式。
用归一化态 \(|R_u\rangle\)、\(|R_d\rangle\) 表示装置对两条路径留下的记录。若记录过程不改变两路到达输出 \(j\) 的幅度 \(a_j,b_j\),这个输出对应的装置态贡献是
\[|v_j\rangle=a_j|R_u\rangle+b_j|R_d\rangle.\]
只统计输出、忽略装置记录,相应概率是这个向量的模平方:
\[\begin{aligned} P_j&=\langle v_j|v_j\rangle\\ &=|a_j|^2+|b_j|^2 +2\operatorname{Re}\!\left[a_j^*b_j\langle R_u|R_d\rangle\right]. \end{aligned}\]
内积 \(\langle R_u|R_d\rangle\) 衡量两种记录态的重叠。没有路径记录时,两态相同,内积为1,恢复原来的干涉式。记录完全可区分时,两态正交,内积为0,干涉项消失;部分可区分时,干涉项的大小和相位由这个内积改变。这里 \(\langle R|\) 是 \(|R\rangle\) 的共轭转置,内积就是对应分量共轭相乘再求和。
例如,在两路幅度都为 \(1/4\) 的输出,同相且无记录时概率为 \(1/4\);留下完全可区分的记录后,概率变为 \(1/8\)。这个变化由系统与装置的关联产生,无须有人查看记录。
环境也能承担记录者的角色,例如散射光携带不同路径的信息。只观察电子而忽略这些记录时,电子的干涉减弱或消失。第6讲将用局部状态的语言系统描述这一过程。
路径记录解释了为什么干涉会消失,也留下一个更深的问题:量子理论给出一组结果的概率,为什么每次测量只留下一个具体记录?退相干说明干涉怎样丢失;单次结果怎样理解,还涉及测量问题。薛定谔猫把这个问题放大到了宏观尺度,感兴趣时可以展开下面的故事。
薛定谔猫:微观叠加怎样关联到宏观结果?
我们刚才计算的是多次试验的概率分布。每做一次实验,探测器又确实留下一个具体结果。量子态中参与相干演化的多个过程,怎样与这样一条记录联系起来?
1935年,薛定谔提出猫的思想实验:设一个微观事件能够触发探测装置,装置再通过一连串机构,把微观差别放大为猫生或死的宏观差别。这个构造把微观系统、探测器和宏观对象连接在一起,使问题格外鲜明 [25]。
猫把单次测量的问题放大到了日常尺度:量子理论给出结果的概率,实验每次留下一个具体结果。 这个思想实验追问微观系统、记录装置与宏观对象怎样共同描述。
可以先用“0”表示微观事件未触发,“1”表示已触发。量子态的符号写作 \(|0\rangle\) 和 \(|1\rangle\),读作“态零”和“态一”。竖线与尖括号把状态标签括起来;系数则是前面已经使用过的复概率幅。若微观系统处于
\[|\psi\rangle=\alpha|0\rangle+\beta|1\rangle,\]
并与记录装置发生理想关联过程,整个系统的描述变为
\[|\Psi\rangle=\alpha|0\rangle|R_0\rangle+\beta|1\rangle|R_1\rangle.\]
这里 \(|R_0\rangle\) 与 \(|R_1\rangle\) 是两种可区分的记录状态。相邻的两个态标签表示两个系统共同处于相应状态:例如 \(|0\rangle|R_0\rangle\) 表示微观状态0与装置记录0配对。理想的线性演化把两个可能过程共同带到了联合态中。
读这个式子时,问题就落在“联合态”与“具体记录”的联系上。量子预测规则给出记录0和1的概率为 \(|\alpha|^2\) 和 \(|\beta|^2\);实验每次获得其中一条记录。怎样理解单次结果的出现,是测量问题持续讨论的内容。
量子纠缠:两个系统共同拥有的状态
上面讨论了电子与路径记录的关联。现在考察两个光子的联合纯态:能否给每个光子各指定一个纯态,再用两者的乘积描述整体? 如果不能,这个联合纯态就是纠缠态。下面用偏振说明这种不可分性,以及它与经典配对的区别。
两个光子的相干联合态
线偏振的方向对应电场振动的方向;水平和竖直是两个正交的偏振方向。用 \(A\)、\(B\) 标记两个光子,用 \(H\)、\(V\) 表示这两个偏振态。课堂讨论的理想态是
\[|\Phi^+\rangle=\frac{|H\rangle_A|H\rangle_B+|V\rangle_A|V\rangle_B}{\sqrt2}.\]
式中的两项分别是“都水平”和“都竖直”。它们保持相干,描述两个光子的整体;不能用A、B各自独立的纯态代替。这是本例的纠缠性质。每个光子仍有局部状态描述,只是它的局部状态为混态;“不可分”不是说无法分别测量。
两端都按水平/竖直偏振测量,结果HH、VV各占一半,而HV、VH不出现。只看A或只看B,各自仍然随机。可是,随机各半准备HH或VV,也会给出同一组记录。一次测量设置下的相关性,还不足以认证纠缠。 接下来要改变测量设置,看相干联合态和普通配对能否继续给出相同的预测。
课堂中的扫雷梗图只借用了“知道一处,可以推断另一处”的直觉。扫雷的格子已有经典配置;这种相关性不能解释量子纠缠或Bell违背。它正好提醒我们:需要检验的不只是结果相关,而是不同测量设置之间的共同约束。
经典关联:一双手套的左右配对
把一双手套随机装进两个盒子,分别寄到城市A和B。在A打开盒子,看见左手套,就能推断B的是右手套。两边结果相关,而且这组关联可以在出发前安排好。
远处的结果相关,可以来自出发前就安排好的配对。 因此,“看见一边就能推知另一边”本身还不能区分普通配对和纠缠。需要找到一种测量,让它们给出不同的预测。
纠缠与普通配对:怎样用测量区分?
手套的例子只问“左还是右”,没有提供检验量子相位的操作。要让两种解释接受进一步检验,我们需要一种能改变测量方式的物理系统。光子的偏振正好提供了这种选择:转动偏振片,就改变了所检验的偏振方向。 前面以两条路径区分了相干叠加与随机混合;现在让光源每次向A、B两端各发出一个光子,比较两端的偏振测量结果。
偏振片透光轴水平时,检验的是水平偏振;转到正45度时,检验的就是正45度偏振。为了同时记录两个正交方向的结果,实验中可用偏振分束器和两个探测器:把两个偏振分量分别送到两个输出口,而不是像普通吸收型偏振片那样阻挡其中一个。下面先让两端都区分水平与竖直,再改变测量方向,区分正45度与负45度。
对刚才的相干纠缠态和HH、VV各半的随机配对,两端都改测正、负45度偏振,并在相同制备下重新积累记录。此时两种制备给出不同的统计:
| 制备方式 | 两边都测水平/竖直 | 两边都测正45度/负45度 |
|---|---|---|
| 上述理想偏振纠缠态 | 两边结果总是相同 | 两边结果仍然总是相同 |
| 水平、竖直各半的随机配对 | 两边结果总是相同 | 相同和相反各占一半 |
先在现成的 Quantum Flytrap 光学实验台上观察纠缠光子对。中央晶体向左右发出一对光子;两侧的偏振旋转元件先改变偏振,再由固定的偏振分束器送往两个探测器。这与改变测量方向等效。这里的0、1是探测器输出标签;“Alice basis”和“Bob basis”中的0、1则是两种测量设置的编号,别把两者混在一起。
来源:Quantum Flytrap · 模型与实验说明。需联网;课堂演示请用 Edge 打开本讲义。
课堂先做两组比较。 若出现欢迎教程,先点右上角“×”关闭;建议用上方“放大操作”查看光路与右侧记录,结束后点“收起实验”返回正文。
- 两端都测水平/竖直。 暂停播放,右键中央晶体左侧的偏振旋转元件,把“已供电”和“未供电”两栏的“偏振旋转 [度]”都设为0;关闭面板,对右侧元件也做同样设置。点击方形停止键清空上一轮,再播放。两侧固定分束器现在都区分水平与竖直偏振,右侧“实验结果”中A、B输出应相同。
- 两端一起改变方向。 暂停,把左右元件两栏的偏振旋转都改为45度;再停止、播放,重新累计。旋转偏振后再测水平/竖直,相当于原来正45度/负45度这组测量(输出标签的顺序可互换)。A、B仍应相同。正文中的随机配对则预言相同、相反各半。
这里用的是纠缠光子源;表格中的随机配对是另一种制备的理论对照,不能把这个模拟的某个显示模式当作随机配对。固定两端角度时,只比较A、B的逐对记录;底部SUM用于下一节的四组设置检验,此时不读它。屏幕中的波纹是概率幅的可视化,不是拍摄到的光子轨迹。
相位的作用从一个系统扩展到了两个系统的联合状态。 改变偏振测量方向后,纠缠态与随机配对给出不同的关联;整个光子对的状态无法拆成两个独立的确定量子态来描述。
联合态与纠缠态:两个量子比特怎样描述?
为简写偏振,把水平、竖直分别标记为零、一。每个光子的两个正交偏振基矢也可看作一个量子比特,下一节将正式讨论其信息意义。把A放在前、B放在后,联合计算基底有四个基矢:
\[|00\rangle,\quad|01\rangle,\quad|10\rangle,\quad|11\rangle.\]
例如 \(|01\rangle\) 是 \(|0\rangle_A|1\rangle_B\) 的简写,表示A为零、B为一。一个联合纯态可以写成这四个基矢的线性组合,四个系数模平方之和为1。
考虑其中一个特别的态:
\[|\Phi^+\rangle=\frac{|00\rangle+|11\rangle}{\sqrt2}.\]
在零、一基上测量,联合结果00和11各有一半概率,01和10的概率为零。两项之间的加号表示相对相位为零。两边改测正、负基时,这个态仍给出完全相同的结果,下面会逐项比较。
这个态是一个纠缠态:它的联合纯态不能写成两个独立纯态的乘积。只给每一部分各写一个纯态,无法把整体描述完整。
假设A和B各自有纯态 \(a|0\rangle+b|1\rangle\) 与 \(c|0\rangle+d|1\rangle\)。乘开得到
\[ac|00\rangle+ad|01\rangle+bc|10\rangle+bd|11\rangle.\]
若它等于 \(|\Phi^+\rangle\),则需要
\[ac=\frac1{\sqrt2},\quad bd=\frac1{\sqrt2},\quad ad=0,\quad bc=0.\]
前两项要求 \(a,b,c,d\) 全部非零,后两项却要求其中的乘积为零,彼此矛盾。因而不存在这样的乘积分解。
纠缠与概率混合:换一组测量基,关联有何不同?
这里把水平、竖直分别记为 \(|0\rangle\)、\(|1\rangle\),并定义 \(|\pm\rangle=(|0\rangle\pm|1\rangle)/\sqrt2\)。它们对应正、负45度线偏振。按这组关系,可以把联合态写为:
\[|\Phi^+\rangle=\frac{|++\rangle+|--\rangle}{\sqrt2}.\]
所以,两边都在正、负基上测量,结果依然相同。
再与另一种制备比较:每次随机准备00或11,各占一半。它在零、一基上也给出完全相同的结果。但对一个确定的00输入,A的正负结果各半,B的正负结果也各半,四个联合结果各有 \(1/4\);11输入同样如此。混合后,在正、负基上得到四种等概率结果。
| 制备 | 两边都测零、一基 | 两边都测正、负基 |
|---|---|---|
| \(|\Phi^+\rangle\) | 总是相同 | 总是相同 |
| 00与11各半的概率混合 | 总是相同 | 四种联合结果各 \(1/4\) |
这张表已经让我们看见联合相位的信息。不过,为这两组测量各自预先写好答案,仍能构造某些经典关联模型。Bell检验要继续追问:更多设置组合的统计能否同时由同一类局域模型解释?
这个对比排除了刚才那种随机分装水平、竖直偏振的解释。但如果换一种更复杂的预先安排,能否解释所有测量方向下的统计?Bell检验将继续追问这个问题。
Bell不等式:局域关联的界限与量子违背
EPR论证:量子力学的描述完整吗?
“是否还有未被量子态写出的预先信息”也是量子力学早期争论的核心。1935年,爱因斯坦、鲍里斯·波多尔斯基(Boris Podolsky)和内森·罗森(Nathan Rosen)提出:对一个系统的测量,若能预测远处另一个系统的结果,而又没有扰动远处系统,那么量子态是否已经包含了描述它所需的全部信息?这是EPR论证所追问的完整性问题。原论证使用位置与动量;这里沿用光子偏振,考察相关的局域解释怎样接受实验检验 [5]。
可以把光子对出发前携带的共同信息当作解释关联的原因。如果每一端的结果只由这些信息和本地偏振测量方向决定,就称为这里讨论的局域模型;另外要求测量方向的选择与这些共同信息独立。1964年,约翰·贝尔(John Bell)证明,这类模型对不同方向组合下的关联有共同限制。实验者因而可以用计数来检验它们 [1]。
一个光子对源向两端发出光子,实验者分别选择两端的偏振测量方向,记录每对光子的两个结果。关键在于比较多种方向组合下的关联,而不只检查同方向时是否相同。
只在同一方向上比较结果,还不能完成这种检验。Bell及后来的CHSH形式把不同设置下的关联组合起来,得到局域模型必须满足的界限。合适的纠缠态与测量设置可以违反这个界限。由此,关于预先携带答案的解释变成了可实验检验的命题。其前提包括局域性和测量设置与隐变量的独立性;并不等于排除了所有想象得到的预设模型。
这个限制怎样变成一个可测的数?把每端的两个输出标为 \(+1\)、\(-1\),每次将两端结果相乘,再对多次记录取平均,得到相关值 \(E\)。结果总是相同时 \(E=1\),总是相反时 \(E=-1\);相同与相反各半时 \(E=0\)。
单独一组相关值容易用预先配对来安排。真正的检验是:同一种局域解释,能否同时符合不同设置组合下的统计? 让A端选两个方向 \(a,a'\),B端选两个方向 \(b,b'\),分别测出四组相关值。CHSH检验把它们按下面的方式组合,使局域模型必须满足的共同限制显现出来:
\[S=E(a,b)+E(a,b')+E(a',b)-E(a',b').\]
刚才所说的局域模型必须满足 \(|S|\leq2\);合适的量子纠缠态和测量方向可以给出 \(|S|=2\sqrt2\approx2.83\)。下面的折叠框说明这个界限和量子预测怎样算出来。
Bell不等式把“关联能否由局域的共同原因解释”变成了一个计数问题。 四组测量算出的 \(|S|\) 是否越过2,就能检验前面明确列出的那组物理假设。
关联函数:怎样统计两端的测量结果?
设一个光子对源向两端分别发出光子。每端选择一个偏振测量方向,并把该测量的两个正交输出标为 \(+1\) 和 \(-1\)。偏振描述光的电场振动方向;对于线偏振,转动分析装置就能改变所区分的两个正交方向。
对固定的一组设置,每次将两端结果相乘:相同结果给 \(+1\),相反结果给 \(-1\)。很多次试验的乘积平均值称为相关函数,记作 \(E\)。若两端角度分别为 \(\theta_A\)、\(\theta_B\),就写作 \(E(\theta_A,\theta_B)\)。
例如,100次记录中80次结果相反、20次相同,那么样本相关值为
\[E\approx\frac{20\times(+1)+80\times(-1)}{100}=-0.6.\]
每端选择两种角度,A用 \(a,a'\),B用 \(b,b'\),于是有四组相关函数。CHSH形式的Bell检验把它们组合成
\[S=E(a,b)+E(a,b')+E(a',b)-E(a',b').\]
字母CHSH来自Clauser、Horne、Shimony和Holt四位作者。他们给出了常用于实验的这一类检验 [4]。
CHSH不等式:局域模型的界限从哪里来?
先考虑每次发射时,某个共同原因已经规定了A在两种设置下的回答 \(A,A'\) 和B的回答 \(B,B'\),这些回答都为 \(+1\) 或 \(-1\)。局域性体现在A的回答只依赖本地设置和共同原因,B亦然;设置独立性意味着选择哪组设置与这些共同原因独立。
对某一次共同原因,四个乘积的组合为
\[C=AB+AB'+A'B-A'B'=A(B+B')+A'(B-B').\]
若 \(B=B'\),则 \(B-B'=0\),\(B+B'=\pm2\);若 \(B=-B'\),则情况互换。无论哪种情况,\(C\) 都只能是 \(+2\) 或 \(-2\)。对许多次共同原因取平均,就得到
\[|S|\leq2.\]
带随机性的局域模型也可以把额外随机变量包括进共同原因,再做同样的平均。因此这个界限约束了一整类模型,而非某一种特定的手套分装办法。
CHSH的量子违背:纠缠态预言怎样的关联?
对前面的理想偏振纠缠态 \(|\Phi^+\rangle\),量子理论给出
\[E(\theta_A,\theta_B)=\cos[2(\theta_A-\theta_B)].\]
先检查两个易懂的角度:同方向测量,\(E=1\),结果总是相同;角度差为 \(45^\circ\) 时,\(E=0\),相同与相反各半。下面的展开段说明这条关系如何从概率幅得到。
把水平和竖直偏振命名为 \(|0\rangle\)、\(|1\rangle\)。沿角度 \(\theta\) 及其正交方向测量线偏振,所区分的两个态可以写成
\[|\theta,+\rangle=\cos\theta|0\rangle+\sin\theta|1\rangle,\] \[|\theta,-\rangle=-\sin\theta|0\rangle+\cos\theta|1\rangle.\]
两个态互相正交,且各自系数平方和为1。沿一个方向的偏振,在另一个方向上分解时,其概率幅由对应分量的投影给出,这就是本例换基的几何意义。
例如两边都记录正号的概率幅为
\[ \frac{\cos\theta_A\cos\theta_B+\sin\theta_A\sin\theta_B}{\sqrt2} =\frac{\cos(\theta_A-\theta_B)}{\sqrt2}. \]
同样计算其他三个组合,记 \(\Delta=\theta_A-\theta_B\),得到
\[P_{++}=P_{--}=\frac12\cos^2\Delta,\] \[P_{+-}=P_{-+}=\frac12\sin^2\Delta.\]
这四个概率之和为1。把同号概率减去异号概率:
\[E=P_{++}+P_{--}-P_{+-}-P_{-+} =\cos^2\Delta-\sin^2\Delta=\cos2\Delta.\]
取四个角度
\[a=0^\circ,\quad a'=45^\circ,\quad b=22.5^\circ,\quad b'=-22.5^\circ.\]
逐项代入:
| 角度组合 | 量子相关值 |
|---|---|
| \(a,b\) | \(+1/\sqrt2\) |
| \(a,b'\) | \(+1/\sqrt2\) |
| \(a',b\) | \(+1/\sqrt2\) |
| \(a',b'\) | \(-1/\sqrt2\) |
所以
\[S=\frac4{\sqrt2}=2\sqrt2,\qquad |S|\approx2.83>2.\]
我们已经把两种描述的差别变成了一个数值比较。下面左图是量子模型的相关曲线,右图比较模型界限;实验则需要用实测的各组计数来估计 \(S\) 及其统计误差。
回到模拟:四组设置怎样汇成一个数?
回到上方的交互实验,点击实验标题右侧的圆形重载按钮,恢复官方光路。它会重新启用“Alice basis”和“Bob basis”对两种设置的随机选择。播放并提高左上角的重复次数,让右侧记录逐渐积累;底部00、01、10、11四栏分别按设置编号分组统计相关值,不能把它们读成四种探测结果的概率。
模拟的SUM采用“加、减、加、加”的组合:若把设置编号0、1分别写成 \(a,a'\) 和 \(b,b'\),它计算的是
\[S_{\mathrm{sim}}=E(a,b)-E(a,b')+E(a',b)+E(a',b').\]
这与上面“加、加、加、减”的CHSH写法只差设置的重命名,局域界限仍是 \(|S_{\mathrm{sim}}|\leq2\)。因此,课堂比较的是SUM的绝对值与2,而不是要求每一项的符号都和前面的算例相同。少量样本会波动,应等四组都有足够记录后再读数。这里显示的是量子模型生成的模拟计数;真实实验的证据见下节。
Bell检验:实验怎样检验局域界限?
纠缠实验的发展,需要稳定的光子对源、可选择的测量设置、可靠的探测器,以及准确配对的记录。实验对设置选择、探测效率、两端空间分离等条件的控制,决定了能够检验怎样的模型假设。
2022年诺贝尔物理学奖授予阿斯佩(Alain Aspect)、克劳泽(John F. Clauser)和蔡林格(Anton Zeilinger),表彰他们在纠缠光子实验、Bell不等式检验和量子信息科学方面的工作 [21]。
实验观察到了超出Bell局域界限的关联,支持量子理论的预测。 纠缠由理论中的联合状态,成为能够制备、测量并检验的实验对象,也为后来的量子信息实验提供了工具。
本地统计与无信号性:每一端单独看见什么?
关联会随两端的测量方向改变,那么,能否让B通过改变偏振测量方向给A发送消息?要做到这一点,A必须仅凭自己收到的记录,就能判断B选了哪个方向。对于这里讨论的纠缠态,A单独看到的两个输出始终各占一半,B改变测量方向也不会改变这一比例。角度改变的影响,要在两端记录汇合比较后才显现。
纠缠的特殊性要在两端记录的比较中显现。 单独一端的随机结果不传递远处选择的消息;利用这种关联,需要安排两端的操作,并在需要时交换普通的经典消息。
设两端测量方向的夹角为 \(\Delta=\theta_A-\theta_B\)。对本节的理想纠缠态,联合概率为 \(P_{++}=\tfrac12\cos^2\Delta\)、\(P_{+-}=\tfrac12\sin^2\Delta\)。把B端两种结果相加,A得到正号的概率是
\[P_A(+)=P_{++}+P_{+-}=\frac12\cos^2\Delta+\frac12\sin^2\Delta=\frac12.\]
B改变角度,A的这个本地概率仍为一半。A得到负号也一样。两边汇合记录时能看见随角度改变的关联;A只看自己的一串结果,无法从中读出B选择的任意消息。
这个计算说明了本例中强关联与本地随机性怎样同时成立。量子隐形传态也需要事先共享纠缠、发送方的测量以及随后传递的经典消息,接收方才能完成相应操作。后面课程会完整追踪状态转移;这里先把“联合统计包含的信息”与“单端能够读出的信息”分清 [13]。
纠缠实验说明,联合量子态能够被制备、控制和检验。接下来转向新的问题:怎样用这些可控状态承载并处理信息?
1.3 量子信息:从联合态到计算任务
量子比特:两个状态与它们之间的相位
前面已经认识了叠加、测量和纠缠:相位能影响结果分布,多个系统还可以拥有不可分的联合态。如果能保持并控制相位,怎样把这种能力组织成一台计算机?先看看熟悉的经典计算机是怎样组织信息的。
经典比特取0或1,可以由高、低电压等两种可区分的物理状态承载。量子计算需要一个能够保留相干叠加的信息单元。
量子比特是二维量子状态空间所承载的信息单元。 选定两个正交基矢 \(|0\rangle\)、\(|1\rangle\),一般纯态写为
\[|\psi\rangle=\alpha|0\rangle+\beta|1\rangle,\qquad |\alpha|^2+|\beta|^2=1.\]
按这组基测量,得到0、1的概率分别是 \(|\alpha|^2\)、\(|\beta|^2\);两项的相对相位影响后续操作的结果。多个量子比特承载信息,量子逻辑门改变它们的状态,最后通过测量读出结果。
原子有多个内部能级。如果选择其中两个,并且实验操作主要限制在这两个能级组成的空间内,就能构造一个有效二能级系统。也可以用光子的水平与竖直偏振承担这两个状态。把水平、竖直这两个正交偏振态命名为0和1,就得到一种光子量子比特。
这个基本单元比“0和1各有多大概率”多了什么?用光子偏振可以直接说明。把水平、竖直作为0和1,沿正45度与负45度偏振的光子,在水平/竖直方向上测量时,都给出各半概率;它们的区别是水平、竖直两项概率幅的相对符号,也就是相对相位。把理想偏振片的透光轴转到正45度,正45度偏振的光子能够通过,负45度偏振的光子则被阻挡。 原先看不见的相位差,变成了可以读出的结果差别。原子量子比特也可以通过受控操作再测量,实现相应的区分。
这两个等幅叠加态记为
\[|+\rangle=\frac{|0\rangle+|1\rangle}{\sqrt2},\qquad |-\rangle=\frac{|0\rangle-|1\rangle}{\sqrt2}.\]
在偏振编码中,它们对应正、负45度线偏振。这两个记号明确保留相对符号;它们不是“0与1各半”的同一个随机混合。
量子比特为量子计算提供了基本信息单元,也把干涉中的相位带进了这个单元的操作。 即使测到0和1的概率相同,不同相位也能经受控操作变成不同结果。要承载更复杂的信息,还需要像组合经典比特一样,把多个量子比特组合起来;下一节就看这种组合会带来什么新性质。
量子比特的相对相位:相同概率背后有何不同?
用 \(|0\rangle\)、\(|1\rangle\) 表示选定的两个基矢,读作“态零”“态一”;竖线和尖括号把状态标签括起来。一个纯量子比特态写作
\[|\psi\rangle=\alpha|0\rangle+\beta|1\rangle, \qquad |\alpha|^2+|\beta|^2=1.\]
零与一是我们选取的一组基矢;“在这组基上测量”就是区分这两个结果。归一化条件保证两个结果的概率之和为1 [12]。
例如 \(\alpha=\sqrt3/2\)、\(\beta=1/2\) 时,结果0的概率为 \(3/4\),结果1为 \(1/4\)。重复1000次相同的制备与测量,平均预期有750个0和250个1。
再看两个态:
\[|+\rangle=\frac{|0\rangle+|1\rangle}{\sqrt2}, \qquad | -\rangle=\frac{|0\rangle-|1\rangle}{\sqrt2}.\]
它们在零、一这组基上都给出各半概率。差别藏在两个系数的相对相位中:加号与减号对应相位差0与 \(\pi\)。换一种合适的测量方式,就能读到这种差别。
测量基的变换:怎样读出相对相位?
把前面两式相加、相减,可得
\[|0\rangle=\frac{|+\rangle+|-\rangle}{\sqrt2}, \qquad |1\rangle=\frac{|+\rangle-|-\rangle}{\sqrt2}.\]
将它们代回一般态:
\[ |\psi\rangle= \frac{\alpha+\beta}{\sqrt2}|+\rangle+ \frac{\alpha-\beta}{\sqrt2}|-\rangle. \]
于是,在正、负这组基上测量的概率就是
\[P_+=\frac{|\alpha+\beta|^2}{2},\qquad P_-=\frac{|\alpha-\beta|^2}{2}.\]
这仍是概率幅先相加再取模平方。对 \(|+\rangle\),代入 \(\alpha=\beta=1/\sqrt2\),得到 \(P_+=1\)、\(P_-=0\);对 \(|-\rangle\),则得到相反结果。两种态在一组基上产生相同概率,在另一组基上却能被完全区分。
我们还可以每次随机制备 \(|0\rangle\) 或 \(|1\rangle\),各占一半。这是一个概率混合。对其中任何一个态,正、负基测量都给各半概率,混合后仍然各半。因此,“每次制备正态”和“随机制备零态或一态”有不同的实验预测。
| 制备方式 | 零、一基测量 | 正、负基测量 |
|---|---|---|
| \(|+\rangle\) | 各半 | 总是正 |
| \(|-\rangle\) | 各半 | 总是负 |
| 零态与一态各半的概率混合 | 各半 | 各半 |
一个量子比特怎样工作,已经可以用制备、相位、操作和读出连起来描述。光场驱动怎样实现这些操作,是后续二能级动力学的任务。
多个量子比特:叠加的是联合状态
一个量子比特选定两个正交基矢;两个量子比特的计算基底则由四个基矢组成:\(|00\rangle\)、\(|01\rangle\)、\(|10\rangle\)、\(|11\rangle\)。第一个标签属于A,第二个属于B。例如,\(|01\rangle\) 表示A为0、B为1。
一般联合纯态为
\[\begin{aligned} |\Psi\rangle={}&a_{00}|00\rangle+a_{01}|01\rangle\\ &+a_{10}|10\rangle+a_{11}|11\rangle, \end{aligned}\]
其中四个复系数的模平方之和为1。按计算基测量所有比特,得到比特串 \(ij\) 的概率为 \(|a_{ij}|^2\)。
| 量子比特数 | 计算基底中的基矢数 | 一次测量所有比特的结果 |
|---|---|---|
| 1 | 2 | 一个0或1 |
| 2 | 4 | 一个两位比特串 |
| \(n\) | \(2^n\) | 一个 \(n\) 位比特串 |
这里的基矢是展开量子态所选取的坐标基底,不是最低能量意义的“基态”。在标准约定下,\(Z\) 算符对 \(|0\rangle\)、\(|1\rangle\) 分别给出本征值 \(+1\)、\(-1\);联合计算基矢是各比特 \(Z\) 算符的共同本征态;是否也是能量本征态,要看系统的哈密顿量。使用“本征态”时,必须说明对应哪个算符。
多个比特的联合态可以纠缠,不能总用每个比特各自独立的纯态来表示。但“有四项”并不保证纠缠:
\[\frac{|00\rangle+|01\rangle+|10\rangle+|11\rangle}{2}=|+\rangle_A|+\rangle_B.\]
它仍是乘积态。前面双光子的 \((|00\rangle+|11\rangle)/\sqrt2\) 则不能作这样的分解。一般联合纯态需要 \(2^n\) 个复振幅来表示,带有特殊结构的状态可能只需很少参数;维数增长本身不保证计算困难或计算加速 [12]。
计算基、联合态与测量规则:IBM Quantum Learning:Multiple systems。
量子操作:制备、控制,再读出
从两条路径推广到多个比特后,实验仍然围绕三个环节展开,但控制的对象现在包括比特之间的关联。
| 环节 | 要做什么 | 与前面例子的联系 |
|---|---|---|
| 制备 | 从可重复的初态开始,产生需要的相干叠加 | 分束、偏振制备,或选定原子的初态 |
| 控制 | 调节相位与比特间耦合,改变联合态的概率幅 | 路径调相、合束、建立双光子关联 |
| 读出 | 得到一个结果;重复制备和测量,估计所需统计量 | 单次亮点、重复形成条纹,或读出一个比特串 |
只改变某个基矢前的相位,不一定改变按该基底测量的概率;通常还需要进一步混合不同分量,让相位进入可观察的分布。算法因此必须同时设计演化与读出。可以控制所有步骤,并不意味着能够一次读出全部振幅。
经典波也能干涉,量子优势在哪里?
干涉不是量子现象独有的标志。 经典的两个波模式也可以编码幅度和相位,模拟许多单比特变换。仅画出条纹,或说不同可能性同时参与演化,都不能建立量子计算优势。
如果用一个独立经典波模式对应一个计算基矢,直接表示一般的 \(n\) 比特纯态,就需要 \(2^n\) 个模式;量子系统则由 \(n\) 个两能级单元构成这样的张量积空间。这个比较说明特定直接编码的资源代价,不是证明所有经典模拟都必须付出指数成本。经典随机变量也有庞大的联合配置空间,因此“可能性很多”同样不能单独作为加速论据。
还要问:所需状态能否高效制备,演化能否用数量可控的操作完成,有限次测量能否取得有用结果,经典后处理需要多少工作?任意状态制备和任意整体变换通常都不便宜。纠缠也不是充分条件:某些能产生纠缠的电路,仍可被经典计算机高效模拟 [9]。
量子优势必须落实到具体任务与完整资源比较。 本讲选Shor算法,是因为它为整数分解提供了量子多项式时间算法,优于目前已知最佳经典通用分解算法的渐近增长;并未证明所有经典分解算法都需要超多项式时间。后面将逐步看见:先在联合态中写入模幂关系,再用受控演化与干涉把周期信息转成可用的测量结果 [24]。
量子信息:量子规律怎样改变信息处理?
前面已把量子比特推广到多比特联合态,明确了制备、控制和读出的任务,也区分了干涉现象与计算优势。现在回到引入量子比特时的计算目标:有了这些可制备、可操控的状态,怎样安排操作,完成一个明确的信息处理任务?
量子信息科学把信息编码在量子态中,通过控制演化和测量来处理它。不同任务使用这些能力的方式不同,本课程会接触四个方向:
| 方向 | 一个具体问题 | 本课程的物理入口 |
|---|---|---|
| 量子计算 | 怎样利用量子操作寻找一个大整数的因子? | 量子比特、受控演化与干涉 |
| 量子通信 | 怎样分发密钥、纠缠或转移未知量子态? | 光子偏振、测量与经典消息 |
| 精密测量 | 怎样更精确地估计频率、时间和场? | 原子相位、Ramsey干涉与光场噪声 |
| 量子模拟 | 怎样用一个可控系统研究另一个量子模型? | 双阱、二能级系统与隧穿 |
量子计算的发展中,理查德·费曼(Richard Feynman)强调了用量子系统模拟量子物理的动机,戴维·德意志(David Deutsch)发展通用量子计算模型,肖尔则给出整数分解这样具有明确计算目标的算法。每一步都让“计算是一种物理过程”变得更加具体。
下面选整数分解,具体追踪“编码信息—控制演化—测量读出”的过程。 开场已经解释RSA为何使整数分解具有实际意义;现在回到公开的乘积,追踪Shor算法怎样寻找因子。
Shor算法:从周期6找回21的因子
我们已经知道多个量子比特可以承载联合叠加,并由操作改变读出分布。但这些操作怎样与整数的因子发生联系?Shor算法先做一个数论上的转换:把找因子联系到寻找模幂余数的周期,再用量子干涉提取周期信息。这个转换是否有用,先看找到周期后怎样拿回21的因子。
从 \(x=0\) 开始,依次计算 \(2^x\) 除以21的余数:
| 指数 \(x\) | 0 | 1 | 2 | 3 | 4 | 5 | 6 | 7 |
|---|---|---|---|---|---|---|---|---|
| 幂值 \(2^x\) | 1 | 2 | 4 | 8 | 16 | 32 | 64 | 128 |
| 除以21的余数 | 1 | 2 | 4 | 8 | 16 | 11 | 1 | 2 |
\(x=6\) 时,余数第一次回到1;再乘以2取余,又得到2,此后重复同一轮序列。
这个序列的最小正周期是6,也称为2模21的阶;寻找这个周期就叫作求阶。由于 \(2^6\) 除以21余1,\(2^6-1\) 能被21整除。利用平方差,
\[2^6-1=(2^3-1)(2^3+1)=7\times9.\]
7与21的最大公因数是7,9与21的最大公因数是3:因子就这样找回来了。对适当选取的底数,类似的周期可以帮助分解大整数;关键是如何高效取得周期信息。
我们刚才靠逐项计算找到了周期。若周期为 \(r\),从1开始,每次乘底数再取余,就要做 \(r\) 次这样的模乘法才首次回到1。对于一个二进制位数为 \(n\) 的整数 \(N\),有 \(2^{n-1}\leq N<2^n\);互素底数的周期在某些输入上可以与 \(N\) 同数量级。因此,逐项求周期最坏需要指数于输入位数的模乘法次数,达到 \(2^n\) 的量级。 把问题改写成求周期,并没有自动使它变容易。
Shor算法用量子操作提取周期信息,所需资源随输入位数按多项式增长 [14, 24]。这里的指数估计只针对刚才的逐项枚举法,并不是所有经典算法的复杂度下界。下面要看的是:怎样不逐项走完整个周期,就把周期信息变成容易读出的测量结果?
算法先用一组量子比特表示许多指数标签的相干叠加,再用受控运算把每个指数与第二组量子比特中的对应余数关联起来。例如,指数0、6、12都对应余数1,周期就体现在联合态里反复出现的对应关系中。但此时直接测量两组量子比特,只会读出其中一对指数与余数。怎样让这些项之间的周期关系影响测量概率,成为容易读出的信息?
波动光学提供了熟悉的线索:光栅的周期排列会使许多贡献在特定方向相长,产生衍射峰。量子算法也可以利用相位相加来显现周期,不过这里重新组合的是整数标签对应的概率幅。它对表示指数的那组量子比特施加量子傅里叶变换:对于每个候选输出,按规定的相位步进叠加各个输入项。相位步进与输入的周期相匹配时,贡献增强,于是得到与周期有关的概率峰。经典计算再根据测量结果提出候选周期,检验后提取因子;必要时重复量子步骤。
相位相加把周期关系转成了输出概率的差异。 Shor算法的计算优势,来自整套联合态制备、受控模幂运算、傅里叶变换与结果恢复所需资源随输入位数按多项式增长。下面的选读算例把其中的相位相加与概率峰完整算出。
模运算与阶:余数序列为什么会重复?
“模21”就是除以21后只保留余数。例如
\[32=1\times21+11,\qquad64=3\times21+1,\]
所以 \(32\bmod21=11\),\(64\bmod21=1\)。余数总可以选在0到20之间。两个整数有相同余数,就称它们模21同余。
现在从 \(2^0=1\) 开始,不断乘以2,每次保留余数。我们得到
| 指数 \(x\) | 0 | 1 | 2 | 3 | 4 | 5 | 6 | 7 |
|---|---|---|---|---|---|---|---|---|
| \(2^x\bmod21\) | 1 | 2 | 4 | 8 | 16 | 11 | 1 | 2 |
第一次回到余数1的是 \(x=6\)。从这里再乘2,又会依次产生2、4、8、16、11、1,因此整个序列重复。
满足
\[2^r\equiv1\pmod{21}\]
的最小正整数 \(r\) 叫作2模21的阶。这个例子中,阶就是余数序列的周期6。它之所以是最小阶,还需要检查1到5都没有给出余数1,表格已经完成了这一步。
从阶到因子:用最大公因数完成分解
已知 \(r=6\),便知道 \(2^6-1\) 能被21整除。因为6是偶数,可以使用平方差分解:
\[2^6-1=(2^3-1)(2^3+1)=7\times9.\]
于是21整除 \(7\times9\)。我们分别检查7和9与21共有的因子。最大的那个公因数记作gcd:
\[\gcd(7,21)=7,\qquad\gcd(9,21)=3.\]
第二个结果可以用余数直接算:\(21=2\times9+3\),\(9=3\times3\),因此最大公因数为3。这个反复做带余除法的过程就是欧几里得算法的基本思路。
我们得到7与3,乘回去检查:
\[21=3\times7.\]
这一次,我们沿着“周期—平方差—最大公因数”的路线找回了因子。关键中间任务是求阶;拿到合适的阶以后,后处理可以由经典计算完成。
设 \(N\) 是待分解的奇合数,选择 \(1<a<N\)。先计算 \(\gcd(a,N)\);若已经得到介于1与 \(N\) 之间的因子,就取得了分解进展。若最大公因数为1,再寻找最小正阶 \(r\):
\[a^r\equiv1\pmod N.\]
当 \(r\) 为偶数,且 \(a^{r/2}\not\equiv-1\pmod N\) 时,计算
\[d_-=\gcd(a^{r/2}-1,N),\qquad d_+=\gcd(a^{r/2}+1,N).\]
最小阶保证 \(a^{r/2}\not\equiv1\pmod N\)。两个因子的乘积被 \(N\) 整除,而它们各自又不是 \(N\) 的倍数,于是最大公因数能给出非平凡因子。若阶是奇数,或半阶幂等于模 \(N\) 的负一,就换底数再试。偶数和素数幂等情况可由经典预处理先处理。
例如对21改选 \(a=4\),其阶为3,这次结果不适用于上述平方差步骤。选择 \(a=2\) 则得到偶数阶6,半阶幂8也不等于模21的正一或负一,所以后处理成功。
量子求阶:Shor算法中量子计算负责哪一步?
刚才的21很小,我们用经典计算已经找到了周期。对大整数,Shor方法利用量子过程高效获得与阶有关的信息。它的整体结构可以写成:
| 阶段 | 完成的工作 |
|---|---|
| 经典准备 | 给定 \(N\),选择底数,计算最大公因数,处理简单情况 |
| 量子求阶 | 编码模运算,通过受控演化与干涉得到周期相关的测量结果 |
| 经典后处理 | 从结果恢复、检验候选阶,再计算最大公因数;必要时重复 |
要理解量子部分,可以借助前面概率幅与联合态的语言。下面仍用周期6做一个有限大小的演示。为了看清图形,取一个能表示0到63的寄存器;“寄存器”就是一组共同存储信息的量子比特,6个量子比特对应 \(2^6=64\) 个计算基矢。
模幂运算:把周期写入两个寄存器的联合态
把第一寄存器准备成64个整数标签的等幅叠加,再让第二寄存器计算相应余数,可得到
\[|\Omega\rangle=\frac1{8}\sum_{x=0}^{63}|x\rangle|2^x\bmod21\rangle.\]
求和符号 \(\sum\) 表示把 \(x=0,1,\ldots,63\) 的项全部相加。每项的幅度为 \(1/8\),模平方为 \(1/64\);第一寄存器的标签不同,64个联合基矢彼此可区分,总概率为1。
这个过程把两个寄存器关联起来:如果第一寄存器的标签为 \(x\),第二寄存器就存有对应余数。模运算可以用可逆电路和受控模乘实现,运算过程保留量子相干性。
为了看清周期结构,设第二寄存器被测到余数1。第一寄存器就只保留那些满足 \(2^x\bmod21=1\) 的标签:
\[|\chi\rangle=\frac1{\sqrt{11}}\bigl(|0\rangle+|6\rangle+|12\rangle+\cdots+|60\rangle\bigr).\]
这里一共11项,每项相隔6。条件化以后要重新归一化,所以幅度变成 \(1/\sqrt{11}\)。周期已经写在这些标签的间隔里。
选取余数1只是为了把一个分支写清楚,不是算法必须等到的成功事件。其他余数对应起点不同、仍以6为间隔的标签序列。也可以不测第二寄存器,直接变换第一寄存器;忽略第二寄存器所得的统计,等于按各分支出现的概率加权平均。
如果此时直接测量第一寄存器,只会得到其中一个标签。接下来要让这些幅度相互干涉,把间隔信息变成更容易读取的分布。
量子傅里叶变换:把周期转成测量概率峰
傅里叶变换是一种把周期结构转换成频域结构的运算。量子寄存器上也可以实现对应的可逆变换。对刚才的周期态做逆离散傅里叶变换后,读到整数 \(k\) 的概率幅为
\[C_k=\frac1{\sqrt{64\times11}} \sum_{\ell=0}^{10}e^{2\pi i(6\ell)k/64}, \qquad k=0,1,\ldots,63.\]
每个加项都可以画成复平面上一支箭头,相邻箭头的相位差为 \(2\pi\times6k/64\)。当这个相位差接近整圈时,各项大致同向,合成幅度较大;在其他位置,箭头部分相消。与单电子干涉一样,最终概率是 \(P_k=|C_k|^2\)。
在这张图里,概率峰接近
\[\frac{k}{64}\approx\frac{s}{6},\qquad s=0,1,2,3,4,5.\]
例如读到 \(k=11\) 时,\(11/64\approx0.1719\),接近 \(1/6\approx0.1667\)。经典后处理寻找合适的简单分数,从而提出候选阶,再验证它。读到 \(k=32\) 对应 \(1/2\),其中的分母只给出阶的一部分信息;更多样本和验证有助于恢复完整的阶。
一般求阶算法会选择足够大的读出寄存器,使分数恢复有足够精度,并通过重复与验证获得高成功率。常见的分析选择 \(N^2\leq Q<2N^2\) 的二次幂寄存器大小 \(Q\);对21可取512。图中的64标签演示专门用来展示相位相加与概率峰的联系。
长度 \(Q\) 的逆离散傅里叶变换,在每个输入标签上定义为
\[|x\rangle\longmapsto\frac1{\sqrt Q}\sum_{k=0}^{Q-1}e^{2\pi i xk/Q}|k\rangle.\]
将 \(Q=64\) 以及 \(x=0,6,\ldots,60\) 代入,再按线性关系相加,就得到正文的 \(C_k\)。这个变换的不同输入列彼此正交且各自归一化,所以它保持总概率为1。对固定 \(k\),可以直接把11个复数加起来重现图中的每个柱子。
从测量结果恢复简单分数,常使用连分数。对 \(11/64\),反复带余相除给出
\[64=5\times11+9,\quad11=1\times9+2,\] \[9=4\times2+1,\quad2=2\times1.\]
因此
\[\frac{11}{64}=\frac1{5+\dfrac1{1+\dfrac1{4+\frac12}}}.\]
截取前两层得到 \(1/(5+1)=1/6\)。把6作为候选阶,用快速模幂检查 \(2^6\bmod21=1\),再用半阶幂和最大公因数得到7与3。这个例子的最小阶6也可与前面的余数表核对。
一般算法不逐个枚举所有更小指数。一次分数恢复可能只给出阶的因子;重复采样、组合候选分母并作模幂检查,才能提高恢复成功率。所得因子还要检查确实整除 \(N\)。这些经典后处理随输入位数保持多项式规模 [14]。
Shor算法的意义
我们现在可以更具体地回答开场问题:Shor把分解联系到求阶,用量子受控演化与干涉获得周期相关信息,再通过经典数论计算提取因子。在理想量子计算模型中,这条路线所需资源随输入位数按多项式规模增长 [24]。
开场的悬念在这里得到回应:干涉能够帮助提取数论问题中的周期信息,进而完成分解。 我们在电子实验中学到的概率幅与相位,现在成为算法的操作对象;Shor算法展示了物理规律怎样参与决定计算能力。
把算法变成实际能力,还需要足够可靠的量子操作。误差会积累,相干性需要维持,纠错会带来额外物理资源。下一步的问题因此重新回到实验室:怎样准备一个量子态,怎样控制它,又怎样读出结果?
1.4 光与控制:把量子算法落实到实验
一台量子计算系统包含什么?
课堂展示的是IBM Quantum System Two,美国波基普西(Poughkeepsie)的超导量子计算系统。照片展示量子处理器及其运行所需的低温、控制电子学和经典计算等基础设施。
照片:IBM,2026年9月10日官方新闻稿配图。这是资料发布日期,照片拍摄日期未标明;配图不是瑞士未来部署系统的现场照。与课堂使用同一幅图片。
不同硬件,实现同样的操作任务
| 平台 | 信息编码的例子 | 控制与读出的例子 |
|---|---|---|
| 超导电路 | 电路的两个低能级 | 微波驱动与谐振器读出 |
| 离子阱、冷原子 | 原子的两个内部状态 | 激光或微波控制,荧光等信号读出 |
| 光子 | 偏振、路径等正交模式 | 光学元件调节相位和模式,光子探测器计数 |
这张表比较物理实现;不代表所有平台都以同样方式、同样资源完成每项任务。本课程用光和原子建立可计算的模型,再理解制备、控制和读出的共同要求。
用光与原子连接后续课程
以原子量子比特为例,要重复运行刚才的算法,就必须让原子每次从指定状态出发,在受控条件下完成操作,并把最后的状态读出来。带电原子称为离子,可以用电场约束在空间中;离子阱正是一种把这些要求落实到实验中的装置。
照片中的电极和连线帮助约束并控制离子;量子比特可编码在离子的两个内部能级上,光场驱动能级变化,探测荧光则可用来区分状态。前面用来解释光谱的能级、用来描述干涉的相位、用来读取结果的探测器,在这里成为计算装置的组成部分。
制备决定每次实验从哪里开始。控制安排概率幅与相位怎样演化,以及不同系统如何相互作用。读出把状态中可访问的信息变成统计记录。个体量子系统的测量与操控,是2012年诺贝尔物理学奖所表彰的实验方向 [20]。
本课程接下来会沿着这些过程展开。第2—6讲建立态、测量、二能级动力学、联合系统和环境的语言;第7—10讲把它们用于单模光场、光子统计以及光与原子的能量交换;第11—12讲进入Ramsey干涉、精密测量和压缩;第13—16讲研究密钥分发、传态、小型算法与双阱模拟。
实现量子算法,最终要落实为实验中的制备、控制和读出。 光与原子既是这段历史的起点,也是实现这些操作的工具。下一讲从光子的偏振开始,亲手建立一个可计算的量子模型。
1.5 课后自查:概念与计算
先做下面六道核心自查,不必展开正文中的长推导。九道计算选做用于练习具体预测,可结合对应的折叠推导完成。作答时尽量说明条件与理由,而不只写结论。
核心自查
1.方程、概率与实验各回答什么?
单电子逐点累积形成条纹。薛定谔方程、玻恩规则和这个实验,各自提供了什么?1927年的电子衍射与1989年的累积演示,在本讲中分别承担什么作用?
薛定谔方程在给定初态和哈密顿量后预测状态的演化;玻恩规则把状态联系到测量结果的概率。实验检验这些预测,并显示局域事件如何积累成干涉统计。1927年电子衍射已为物质波提供证据;1989年实验让逐个到达与整体分布的关系更直观,不能把它当成第一次验证电子波动性的实验。
2.叠加态与随机混合为什么不同?
每次制备等幅、同相的两路叠加,与每次随机选择上路或下路,各占一半。直接测路径能区分它们吗?通过正文的理想平衡合束操作后,两个输出口的概率分别是什么?
直接测路径时,两者均为上、下各半。保持相干的同相叠加,经正文约定的合束操作后,\(D_0\) 的概率为1,\(D_1\) 为0;随机混合则两口各半。差别在于相干项是否存在,不能把叠加简单理解成“不知道粒子预先选了哪条路”。这些比较使用各自重新制备的独立样本。
3.八个基矢,是否就是八个基态?
三个量子比特的计算基底有多少个基矢?一次按计算基测量所有比特,会得到什么?这些基矢是否都是最低能量态,或必然都是能量本征态?
有 \(2^3=8\) 个基矢,一次得到一个三位比特串,例如010。基矢描述展开所用的基底;最低能量“基态”由哈密顿量决定。计算基矢是各比特 \(Z\) 算符的共同本征态,只有哈密顿量在该基底下为对角形式时,才能同时把它们作为能量本征态。一次测量不会读出全部八个振幅。
4.结果总是相同,能证明纠缠吗?
两边都测水平/竖直偏振,记录总是同时水平或同时竖直。这足以证明纠缠吗?怎样区分正文的相干光子对与水平、竖直各半的随机配对?能否利用这种关联传递超光速消息?
不足以;随机配对也产生同样记录。对正文的两种理想制备,两边都改测正、负45度:相干纠缠态仍总是同号,随机配对则同号、异号各半。这排除了这一种随机配对解释;检验更一般的局域预设答案模型还需要Bell检验及其条件。单边结果始终随机,不能由另一端选择可控的本地输出,因而不能据此超光速通信。
5.经典波也会干涉,量子计算为何可能有优势?
评价三句话:“有干涉就有量子优势”“有纠缠就难以经典模拟”“有指数多个振幅就能一次得到指数多个答案”。应怎样提出一个可以检验的量子优势主张?
三句话都不足以成立。经典波也会干涉;部分产生纠缠的电路仍能高效经典模拟;测量只给出一个结果,不能直接读取全部振幅。应指定计算任务、输入规模和成功标准,比较状态制备、操作、测量次数与经典后处理的总资源。Shor算法给出多项式时间的量子分解方案,优于目前已知最佳经典通用方案的渐近增长;这不是对所有可能经典算法的无条件下界证明。
6.从周期到因子,哪一步体现量子算法的任务?
对21不断乘2并取余数,得到最小正周期6。由此求两个非平凡因子。既然能在纸上算出来,课堂这个例子说明了什么,又没有证明什么?
半阶幂为 \(2^3=8\),所以 \(\gcd(8-1,21)=7\)、\(\gcd(8+1,21)=3\)。这个小例子解释求阶如何通过经典后处理得到因子。21本身可轻易经典计算;量子算法的资源意义在于输入位数增长时如何获得周期信息,不能用手算21展示实际量子加速。
计算选做
第1—3题练习光谱与能量,第4—7题练习概率幅和关联,第8—9题练习求阶与傅里叶读出。先自行计算,再展开解答。
选做1.黑体图的短波端
固定温度,把波长减小到原来的一半,Rayleigh–Jeans公式预言谱辐亮度变为几倍?Planck曲线在足够短的波长处又怎样变化?回答时说明你讨论的是哪一种谱。
本讲使用每单位波长的谱辐亮度 \(B_\lambda\)。Rayleigh–Jeans公式正比于 \(\lambda^{-4}\),因此变为 \(2^4=16\) 倍。Planck公式在 \(\lambda\to0\) 时,指数抑制超过前面的逆幂增长,曲线趋于零。展开框中的理论比较图显示,橙色Rayleigh–Jeans虚线向短波端越出图幅,蓝色Planck曲线在峰值左侧最终下降;正文教材图中的圆点表示实验曲线,普朗克曲线贴近这些实验点。
选做2.光电效应:计算光子能量与电子动能
取一种逸出功为2 eV的示例金属,用450 nm的光照射。计算光子能量和电子最大动能。若波长固定,把光强增大一倍,单光子模型中哪一项主要发生变化?
光子能量约为 \(1240/450=2.76\ \mathrm{eV}\),最大动能约为 \(2.76-2=0.76\ \mathrm{eV}\)。同样的波长意味着单个光子能量相同;在材料状态和探测条件保持不变、响应处于线性范围时,增大光强主要增加电子事件的平均速率。
选做3.从能级差预测谱线
用氢原子近似能级公式,估算 \(n=4\) 到 \(n=2\) 跃迁所发光子的能量和波长,再与谱线图核对。
\[\Delta E\approx13.6\left(\frac14-\frac1{16}\right)\mathrm{eV}=2.55\ \mathrm{eV}.\]
\[\lambda\approx\frac{1240}{2.55}\ \mathrm{nm}\approx486\ \mathrm{nm}.\]
它对应计算框图中约486.3 nm的真空模型谱线。正文NIST对比图标注约486.1 nm的空气波长;两者还涉及真空与空气波长的区别,不能把全部差异都归为舍入。
选做4.两路干涉:相位差为60度时的概率
在单位置模型中取 \(a=1/4\)、\(b=e^{i\phi}/4\)。令 \(\phi=\pi/3\),用实部与虚部计算一次概率,再用余弦公式计算一次。
\[e^{i\pi/3}=\frac12+i\frac{\sqrt3}{2},\qquad a+b=\frac38+i\frac{\sqrt3}{8}.\]
\[P=\frac9{64}+\frac3{64}=\frac3{16}.\]
余弦公式给出
\[P=(1+\cos(\pi/3))/8=(1+1/2)/8=3/16.\]
选做5.量子比特:相同测量概率与不同相对相位
比较两个态
\[|\psi_1\rangle=\frac{\sqrt3}{2}|0\rangle+\frac12|1\rangle,\] \[|\psi_2\rangle=\frac{\sqrt3}{2}|0\rangle+\frac{i}{2}|1\rangle.\]
分别计算零、一基和正、负基测量的概率。怎样选择测量,才能分辨两种制备的统计结果?
两个态的零、一基概率都是 \(3/4\)、\(1/4\)。对第一个态,
\[P_+=\frac{(\sqrt3+1)^2}{8}=\frac{2+\sqrt3}{4},\qquad P_-=\frac{2-\sqrt3}{4}.\]
对第二个态,\(|\sqrt3+i|^2=4\),所以 \(P_+=P_-=1/2\)。正、负基上的多次测量能够分辨这两种制备的统计分布。
选做6.纠缠态测量:条件概率与本地概率
对 \(|\Phi^+\rangle\),两边都在正、负基上测量。A的结果是正时,B的结果是什么?若B还没有得到A的记录,只看自己的许多次测量,会看见怎样的概率?
由 \(|\Phi^+\rangle=(|++\rangle+|--\rangle)/\sqrt2\),已知A为正时,B必为正。但没有条件在A的某个结果上时,B的正、负结果仍各半。条件概率使用了额外记录,本地概率把另一端的所有可能结果加总。
选做7.有纠缠,任意角度都给Bell违背吗?
仍使用正文的偏振纠缠态,但将 \(a,a',b,b'\) 全部取为零。计算四个相关函数及 \(S\),与正文的四角度选择比较。
每个角度差都是零,因此四个相关值都是 \(+1\)。于是
\[S=1+1+1-1=2.\]
这组设置达到局域界限,未越过它。正文的四个合适角度才给出 \(|S|=2\sqrt2\)。在具体实验中观察Bell违背,需要同时考虑状态和测量设置。
选做8.求阶与分解:更换底数,分解21
试用底数8:计算 \(8^x\bmod21\) 的最小正周期,并进行平方差与最大公因数后处理。再解释为什么底数4得到的阶不能直接用于同一步骤。
因为 \(8^1\bmod21=8\)、\(8^2\bmod21=1\),最小正阶为2。半阶幂为8,
\[\gcd(8-1,21)=7,\qquad\gcd(8+1,21)=3.\]
底数4的余数序列为1、4、16、1,阶为3,是奇数,因而需要改选底数或使用其他后处理路径。
选做9.量子傅里叶变换:从概率峰读取周期信息
对Shor算法“完整算例”折叠框中的11项周期态,计算 \(k=0\) 和 \(k=32\) 时的概率。为什么只得到其中一个测量值,还可能不足以直接确定阶为6?
两种情况下,每个相位因子都为1。因此
\[C_0=C_{32}=\frac{11}{\sqrt{64\times11}},\qquad P_0=P_{32}=\frac{11}{64}.\]
读到0只给出零频信息;读到32对应 \(32/64=1/2\),分母可能只是阶的一个因子。需要其他样本、候选恢复与验证来获得完整阶。
1.6 图像与进一步阅读
本讲实验照片、教材插图和人物图的出处见插图来源。各图图注区分实验图像、教材示意与模型计算。
想再读概率幅,可以从《费曼物理学讲义》第三卷第一章进入 [6]。 想沿光与原子继续学习,可参考Mark Fox的《Quantum Optics》 [7]。 补充讲义A用Mach–Zehnder装置展开单光子干涉,补充讲义B连接光子能量、平均功率与通量。
关于纠缠与Bell,可先读诺贝尔奖官方介绍,再沿Bell不等式和CHSH不等式的原论文追踪模型假设与实验形式 [1, 4, 21]。 关于Shor算法,原论文说明算法的资源意义,IBM Quantum Learning提供求阶、相位估计与后处理的进一步学习路线 [14, 24]。
进一步阅读可以按最感兴趣的问题选择。下一讲将用偏振实验,把这里接触到的量子态、测量与相位写成系统的计算规则。






















