用自适应梯度下降求解电磁反演问题:向深度学习借一种更省时的优化器

论文信息:Liu, L., Yang, B., Zhang, Y., Xu, Y., Peng, Z., & Wang, F. (2023). Solving Electromagnetic Inverse Problem Using Adaptive Gradient Descent Algorithm. IEEE Transactions on Geoscience and Remote Sensing, 61, 5902415. https://doi.org/10.1109/TGRS.2023.3239106 大地电磁(MT)等频率域电磁(EM)反演属于典型的非线性、非唯一地球物理反问题,工程上多采用线性化迭代求解。其中非线性共轭梯度(NLCG)算法因实现简单、内存需求低而广受欢迎,但它每一步都要做费力费时的线搜索来确定步长——这正是本文想要"动刀"的地方。本文作者之一张壹参与的研究把深度学习里早已成熟的自适应梯度下降(AGD)算法引入 EM 反演,用简单的代数累积代替线搜索,在保持结果可比的同时,把计算成本砍掉三分之一以上。下面围绕这篇 IEEE TGRS 论文,梳理其动机、方法要点与主要结论。 为什么 NLCG 反演"贵"在线搜索 在 NLCG 的每次迭代里,模型梯度决定了搜索方向,而线搜索负责确定步长。线搜索每次通常要多次求解相应的正演问题;即便采用高效的伴随方程法,梯度估计本身也大致要花一次正演两倍的计算量,而线搜索至少还要再额外付出一到两次正演。粗略估算下来,线搜索约占 NLCG 总成本的三分之一。对于需要反复迭代、每个样本都要正演的大型 EM 反演,这一块开销相当可观。 一个自然的想法是:能不能不做线搜索?深度学习社区在过去十年里给出了答案——自适应梯度下降(AGD)。它的核心是把历次迭代累积的梯度与模型更新用简单的代数运算来估计当前迭代的模型参数,从而彻底躲开耗时的线搜索。从 Adagrad 到 Adadelta、RMSProp,再到广泛使用的 Adam 及其变体(Adamax、NAdam、AMSGrad),这些算法在深度学习里已被验证得非常成熟。尽管在地震全波形反演中已有研究指出 AGD 相对 NLCG / L-BFGS 在时间与分辨率上的优势,但不同研究也存在分歧,且此前尚无将 AGD 用于 EM 数据反演的系统工作。这正是本研究要填补的空白。 方法:用累积梯度替代线搜索的 AGD 反演框架 AGD 家族共享一个朴素而漂亮的思想:不再费力去"试"一个标量步长,而是把每次迭代的梯度(及其平方)累积起来,用它们自适应地调节每个模型参数的学习率,从而把步长从标量变成向量(逐参数不同)。以最简洁的 Adagrad 为例,模型更新形如 ...

August 23, 2026 · 2 分钟 · 338 字 · 张壹