Lévy 梯度下降(L-GD):地球物理反演的随机搜索新算法
论文信息:Zhang, Y., Xu, Y., & Yang, B. (2021). Lévy Gradient Descent: Augmented Random Search for Geophysical Inverse Problems. Surveys in Geophysics, 42, 1109–1132. https://doi.org/10.1007/s10712-021-09644-6 地球物理反演的难点在于:一方面,位场、电磁、地震波等观测的解析都依赖对地下模型的"正演",而反演往往是非线性、欠定(ill-posed)的;另一方面,如何评估反演结果的可信度——即给出模型参数的不确定度——始终是实际工作中的难题。本文以一作张壹为代表提出了一种新的随机搜索算法 Lévy 梯度下降(L-GD),它把自然界中常见的**莱维飞行(Lévy flights)**思想引入梯度下降框架,试图同时获得传统两类反演方法的优点:梯度法的效率,以及随机/贝叶斯方法的全局收敛性与不确定度估计。下面围绕这篇 Surveys in Geophysics 论文,梳理其动机、方法、数值实验与结论。 研究背景:确定性反演与概率反演的取舍 把地下空间离散成网格,构造"数据拟合 + 模型约束"的目标函数,反演问题就转化为一个最优化问题。按求解算法,主流方法大体可分两类: 确定性反演:基于目标函数对模型参数的梯度的算法,如经典梯度下降、共轭梯度(CG)、L-BFGS 等拟牛顿类方法。它们对连续凸问题极其高效,广泛用于大规模 2D/3D 反演(重力、磁法、MT、地震走时等)。但面对非线性、病态的非凸问题,这类算法容易收敛到局部极小值(或鞍点),结果强烈依赖初始模型;更重要的是,它们通常不提供模型参数的不确定度。若要估计误差,只能在线性化、局部子空间或修改正则化约束等近似下进行,统计有效性常受到质疑。 概率反演(贝叶斯反演):把模型参数视为概率分布,用 MCMC 等采样技术探索后验分布。它能天然给出误差分布,但计算量往往比梯度法大一到两个数量级,且随参数个数急剧增长,难以直接用于大规模 3D 反演;通常也不直接给出一个"最优模型"。 于是自然产生一个设想:能否设计一种方法,既像梯度法那样高效、可直接用于大规模反演,又具备随机/贝叶斯方法的全局收敛性与不确定度估计能力?本文提出的 L-GD 正是对这一问题的尝试。 方法:用 Lévy 飞行驱动梯度下降 L-GD 的基本思想非常直观:与经典梯度下降一样,每次迭代都沿目标函数梯度给出的下降方向搜索;唯一的区别在于,它不使用固定(或逐渐减小的)步长,而是从 Lévy 分布中随机抽取步长。 莱维飞行是一类特殊的随机游走:路径由大量小步长与少量大步长组成(图1)。这种运动模式广泛存在于动物觅食、流体动力学、光的输运、人类出行乃至地震时空分布等领域。与著名的布朗运动(步长服从正态分布、覆盖面积小)相比,莱维飞行在步数相同时能覆盖大得多的区域,因而对稀疏目标的搜索效率更高。 关键的性质在于:莱维分布的最大值是无穷大的。这意味着即使偶然陷入局部极小值,L-GD 在有限次搜索内也有概率通过一个很大的步长"跳出"局部极值——这正是其全局收敛性的来源。同时,由于搜索过程本质上是一个马尔可夫过程,随着搜索步增长,它会收敛到与初始模型无关的某种后验分布,因此搜索路径的统计量可以用来评估反演模型的不确定度,而不需要额外的后验采样。 算法对外输出三类结果:平均模型 m_mean、标准差 m_sd(即不确定度)以及历史最优模型 m_best(使目标函数最小的那个);并设有停滞检测(stagnation test)以避免梯度消失导致算法卡在鞍点。为保证不同量纲、不同尺度的参数能同时反演,算法对参数空间做了归一化(尺度因子 p)。 莱维步长采用Mantegna 算法生成,其中指数因子 𝛽 ∈ (1,2) 控制分布形态(𝛽 越大分布越快趋近高斯过程)。数值统计实验表明:𝛽 越大,最大和平均步长越小、路径越稳定;𝛽 越小,越容易产生超大步长,对参数空间的穿越效率越高(表1中最大步长的均值跨了约三个数量级)。因此 𝛽 就像一把"旋钮",用来在路径稳定与搜索强度之间权衡。加上一个步长尺度因子 𝛼(默认约 0.01–0.1),用于整体缩放步长、调节收敛速度。 ...