基于好奇心奖励增强个性化多轮对话
机器学习
2025-07-17 v2 图像与视频处理
化学物理
摘要
像大型语言模型(LLM)这样的有效对话代理必须个性化其交互,以适应用户在教育和医疗等多种领域的偏好、性格和属性。当前方法如从人类反馈强化学习(RLHF),往往侧重于有用性和安全性,但在培育真正同理、适应且个性化的对话方面不足。现有的个性化方法通常依赖大量用户历史记录,限制了其对新用户或情境受限用户的有效性。为此,我们提出利用用户模型纳入基于好奇心的内在奖励机制于多轮RLHF中。这种新颖的奖励机制鼓励LLM代理主动推断用户特征,通过优化对话以提高用户模型的准确性。从而,代理能够通过更深入地了解用户来提供更个性化的交互。我们在两个不同领域展示了该方法的有效性:在对话推荐任务中显著提升个性化性能,在教育场景中为不同学习风格个性化对话。我们展示了该方法在保持对话质量的同时,相较于传统多轮RLHF具有更好的泛化能力。该方法为创建更具个性化、适应性和引人入胜的对话代理提供了有前景的解决方案。
引用
@article{arxiv.2504.03205,
title = {BondMatcher: H-Bond Stability Analysis in Molecular Systems},
author = {Thomas Daniel and Malgorzata Olejniczak and Julien Tierny},
journal= {arXiv preprint arXiv:2504.03205},
year = {2025}
}
备注
To appear in IEEE Transactions on Visualization and Computer Graphics (Proc. of IEEE VIS 2025)