Self-Harmony:学习在测试时强化学习中实现自和谐
计算与语言
2026-03-03 v2 人工智能
机器学习
摘要
测试时强化学习(TTRL)提供了一种仅使用合成信号进行推理适应的无标签范式,但其成功依赖于构建可靠的学习信号。标准方法如多数投票常常会退化为不实且流行的答案。我们引入Self-Harmony,基于简单直觉构建:正确答案应在原始问题及其改写版本下保持稳定。Self-Harmony 通过采用单一模型的两种互补角色来实现这一点:Solver 负责生成答案,Reframer 负责改写输入。基于此,我们进一步提出了伪标签方法:而非多数投票,它聚合这些原始视图和改写视图中的答案频率,使用调和平均数。这一过程自然地选择在改写下保持稳定的解,从而避免了常见的陷阱,即偏好基于视图的、虚假的答案。关键的是,这不需要人工监督或辅助模型。在多样化的推理基准测试中,Self-Harmony 在无标签测试时刻实现了最先进成绩,在多个方法的30个设置中排名第一。除准确率外,它展现了前所未有的鲁棒性,在所有实验中实现零训练失败,凸显其稳定性和可靠性。
引用
@article{arxiv.2511.01191,
title = {Self-Harmony: Learning to Harmonize Self-Supervision and Self-Play in Test-Time Reinforcement Learning},
author = {Ru Wang and Wei Huang and Qi Cao and Yusuke Iwasawa and Yutaka Matsuo and Jiaxian Guo},
journal= {arXiv preprint arXiv:2511.01191},
year = {2026}
}
备注
Accepted at the 14th International Conference on Learning Representations (ICLR 2026), Poster