策略优化链使大型语言模型成为更好的情感支持者
计算与语言
2025-09-22 v3
摘要
现代社会日益增加的情感压力提高了对情感支持对话(ESC)的需求。尽管大型语言模型(LLM)在 ESC 方面展现出前景,但它们面临两个关键挑战:(1)策略选择准确率低,以及(2)偏好偏差,限制了它们对用户情感需求的适应能力。现有的监督微调(SFT)难以解决这些问题,因为它在单一的黄金标准响应上僵化地训练模型,而没有对细微的策略权衡进行建模。为了克服这些局限性,我们提出了策略优化链(CSO),这是一种在每个对话轮次优化策略选择偏好的新方法。我们首先利用蒙特卡洛树搜索构建了 ESC-Pro,这是一个包含轮次级策略-响应对的高质量偏好数据集。在 ESC-Pro 上使用 CSO 进行训练提高了策略准确性并缓解了偏差,使 LLM 能够生成更具同理心和上下文适宜的响应。在 LLaMA-3.1-8B、Gemma-2-9B 和 Qwen2.5-7B 上的实验表明,CSO 优于标准 SFT,突显了 ESC 中细粒度、轮次级偏好建模的有效性。
引用
@article{arxiv.2503.05362,
title = {Chain of Strategy Optimization Makes Large Language Models Better Emotional Supporter},
author = {Weixiang Zhao and Xingyu Sui and Xinyang Han and Yang Deng and Yulin Hu and Jiahe Guo and Libo Qin and Qianyun Du and Shijin Wang and Yanyan Zhao and Bing Qin and Ting Liu},
journal= {arXiv preprint arXiv:2503.05362},
year = {2025}
}
备注
21 pages, 9 figures, 17 tables