KARMA:与因果力匹配的奖励模型适应
计算与语言
2026-05-27 v1
摘要
人类交流依赖于隐含的社会信号,其中效果受语气、语境和对话规范的影响,而不仅仅是语义内容。我们引入 KARMA(Karma-Aligned Reward Model Adaptation),一个来自大规模社交互动数据学习上下文敏感对话行为的框架。KARMA 在 Reddit 对话中训练奖励模型,以预测特定语境下的响应价值,并使用该信号通过强化学习微调语言模型以提高在语义-mediated 任务上的性能。关键的是,我们发现最高性能的奖励模型并不导致更好的下游模型对齐:一个仅依赖对话语境的奖励模型虽然是 Reddit karma 的较差预测器,但却在下游任务上获得显著更好的性能。我们评估了 KARMA 应用于下游模型(有无直接暴露于社交媒体数据)的效果。 resulting models 显示在语义-mediated 行为方面表现出改进,同时大幅减轻了不可取的副作用。事实上在所有条件下 KARMA 都持续削弱事实性,包括下游模型未直接暴露于 Reddit 数据的情况下,这表明这种张力是内嵌在奖励信号本身的,而非由噪声训练数据引入。
引用
@article{arxiv.2605.26738,
title = {KARMA: Karma-Aligned Reward Model Adaptation},
author = {Jared Scott and Jesse Roberts},
journal= {arXiv preprint arXiv:2605.26738},
year = {2026}
}