姑苏实验室在束线智能调控方向取得重要进展
发布时间:2026-07-06
近日,姑苏实验室AI大模型与运筹决策平台联合光电工程化平台在同步辐射束线智能调控方向取得重要进展。相关成果以“Action-attentive deep reinforcement learning for autonomous alignment of beamlines”为题,于2026年6月25日在线发表于人工智能与软计算领域高水平国际期刊《Applied Soft Computing》。该研究由姑苏实验室AI大模型与运筹决策平台和光电工程化平台合作完成,AI大模型与运筹决策平台负责人王思宇博士为论文第一作者,光电工程化平台负责人张俊斌博士为论文通讯作者。

图1 期刊标题及封面
同步辐射光源是材料科学、生命科学、化学等领域的重要科研基础设施,束线则承担着光束传输、整形与聚焦等关键任务。束线状态的细微变化,往往会直接影响实验数据质量和装置运行效率。长期以来,束线对准主要依赖经验丰富的工程师逐项调节光学元件,过程耗时耗力,也难以在复杂工况下始终保持高效稳定。围绕这一关键问题,研究团队尝试将人工智能方法引入束线自动调控,推动束线对准从“经验驱动”向“智能决策”转变。

图2 仿真束线系统结构示意图
针对现有贝叶斯优化、遗传算法等方法在束线对准任务中,对当前状态与目标状态之间关系刻画不足、对不同光学器件物理作用差异考虑不够的问题,团队将束线自主对准建模为马尔可夫决策过程,并在此基础上提出动作注意力深度强化学习方法。该方法能够根据目标输出与当前光斑状态之间的偏差,动态判断当前更需要调整哪些器件、哪些参数,从而形成更贴近真实工程决策逻辑的调控策略,提升束线自主对准的效率与精度。

图3 动作注意力深度强化学习方法框架
为验证方法有效性,研究团队基于Zemax构建了两套仿真束线系统,并与差分进化、遗传算法、粒子群优化、贝叶斯优化以及经典DDPG强化学习方法进行了系统对比。结果显示,在System 1中,当误差阈值为0.1、最大迭代步数为50时,团队方法的目标覆盖率达到0.999,平均仅需3.308步即可找到目标状态;在更复杂的System 2中,同样条件下覆盖率达到0.985,平均迭代步数为3.743,均显著优于对比方法。消融实验进一步表明,动作注意力机制能够帮助模型在不同步骤中动态聚焦更关键的器件参数,是实现性能提升的重要原因。

图4 不同算法在典型案例中的收敛过程对比
该成果表明,面向复杂光学系统的强化学习方法,特别是具备任务感知与参数选择能力的动作注意力机制,能够为束线自动调控提供更高效的技术路径,也为人工智能与光电工程的深度融合提供了新的应用思路。未来,团队将继续推动相关方法从代理环境走向真实束线场景,探索与在线观测数据、观察者模式优化策略等进一步结合,为大科学装置的高效、精准、自主运行提供更强支撑。
感兴趣的读者可以通过下方链接获取论文全文。论文地址:https://doi.org/10.1016/j.asoc.2026.115836
姑苏实验室AI大模型与运筹决策平台致力于自然语言处理、大语言模型以及强化学习等AI细分领域的研发和创新应用,我们紧跟技术发展前沿趋势,并追求和行业需求深度结合,欢迎各界沟通交流。





苏公网安备 32059002003194号