通过大型语言模型多模态奖励分解利用全局反馈对齐对话智能体
计算与语言
2026-02-12 v2
摘要
我们提出了一种基于大型语言模型的奖励分解框架,用于仅使用单一的会话级反馈信号来对齐对话智能体。我们利用一个冻结的、预训练的大型语言模型 (LLM) 的推理能力,通过分解全局的会话级反馈来推断细粒度的局部隐式奖励。我们的第一个“纯文本”变体提示 LLM 仅使用对话记录来执行奖励分解。第二个“多模态”变体则融入了额外的行为线索,例如以自然语言描述表达的语调、凝视和面部情感。这些推断出的轮次级奖励被蒸馏到一个轻量级的奖励模型中,我们利用该模型进行基于强化学习的对话生成微调。我们将纯文本和多模态变体与最先进的奖励分解方法进行了评估,并在对话质量的人工评估中展示了显著的改进,这表明 LLMs 是强大的奖励分解器,无需手动设计奖励和细粒度的人工反馈。
引用
@article{arxiv.2505.15922,
title = {Aligning Dialogue Agents with Global Feedback via Large Language Model Multimodal Reward Decomposition},
author = {Dong Won Lee and Hae Won Park and Cynthia Breazeal and Louis-Philippe Morency},
journal= {arXiv preprint arXiv:2505.15922},
year = {2026}
}
备注
9 pages, 3 figures, 3 tables