多轮共情对话中的话语多样性
计算与语言
2026-04-14 v1 人工智能
摘要
大型语言模型 (LLM) 在单轮设置下被评价为高度共情 (Ayers 等人, 2023; Lee 等人, 2024),但也已知是会重复相同词汇模式、句法模板和话语结构的公式化生成器 (Jiang 等人, 2025; Shaib 等人, 2024; Namuduri 等人, 2025)。有关这种公式化现象是否延伸至话语层面——即响应对付诸施了什么——的关注相对不足。这一问题在共情对话中尤为重要,因为有效支持不仅要求在单个时刻给出温柔的回应,而且需要在对话展开时运用多样化的策略 (Stiles 等人, 1998)。事实上,已有研究表明 LLM 在单轮设置下会比人类支持者重复相同的战术序列 (Gueorguieva 等人, 2026)。我们将此分析扩展到多轮对话中,发现僵化性会加剧:一旦某一战术出现在支持者的回合中,LLM 在下一轮几乎以双倍的速率重复使用它 (0.50-0.56 vs. 0.27)。这一模式在作为支持者参与真实情感支持对话的 LLM 中均成立,且对标准相似度度量标准而言则不可见。为弥补这一差距,我们引入了 MINT (Multi-turn Inter-tactic Novelty Training),这是第一个针对多轮共情对话优化话语移动多样性的强化学习框架。最佳的 MINT 变体结合了共情质量奖励与跨轮战术新颖性信号,在 17B 和 4B 参数模型上均将整体共情提升了 25.3%,同时在 4B 参数模型上将跨轮话语移动重复率降低 26.3%,在两项指标上均超越所有基线,包括仅质量的基线和 token 级别的多样性方法。这些结果表明,当前模型缺乏的并非共情本身,而是跨对话变更其话语移动的能力。
引用
@article{arxiv.2604.11742,
title = {Discourse Diversity in Multi-Turn Empathic Dialogue},
author = {Hongli Zhan and Emma S. Gueorguieva and Javier Hernandez and Jina Suh and Desmond C. Ong and Junyi Jessy Li},
journal= {arXiv preprint arXiv:2604.11742},
year = {2026}
}