中文

无交互式逆向强化学习:面向持久对齐的数据主导框架

机器学习 2026-03-26 v2

摘要

AI 对齐问题日益突出,但许多当前方法通过直接修改策略参数来学习安全行为,将规范约束与底层策略交织在一起。这往往导致对齐制品晦涩难编辑,跨模型或跨部署的复用受限,我们称之为“对齐浪费”。我们提出无交互式逆向强化学习(Interactionless Inverse Reinforcement Learning),这是一种学习可检查、可编辑、可复用的奖励制品的框架,这些制品可独立于策略优化进行学习。我们进一步引入了“对齐飞轮”(Alignment Flywheel),一种人类在回路中的生命周期,用于通过自动化评估和细化来迭代审计、修补和加固这些制品。这些想法共同将对齐从一次性训练开销,转变为可持久、可验证的工程资产。

关键词

引用

@article{arxiv.2602.14844,
  title  = {Interactionless Inverse Reinforcement Learning: A Data-Centric Framework for Durable Alignment},
  author = {Elias Malomgré and Pieter Simoens},
  journal= {arXiv preprint arXiv:2602.14844},
  year   = {2026}
}

备注

Accepted for the AAMAS 2026 Blue Sky Ideas track