通过不确定性估计缓解情感支持对话中的策略偏好偏差
计算与语言
2025-09-17 v1
摘要
情感支持对话(ESC)旨在通过共情对话缓解痛苦,然而大型语言模型由于策略规划的准确性较低,在提供有效 ESC 方面面临持续的挑战。此外,模型对特定策略存在相当大的偏好偏差。先前使用微调策略规划器的方法在减少此类偏差方面展现了潜力,但 LLM 中偏好偏差的潜在原因尚未得到充分研究。为了解决这些问题,我们首先通过识别 LLM 在策略规划中的知识边界来揭示偏差的根本原因。然后,我们提出了一种利用双奖励函数的强化学习方法来缓解该偏差,该方法根据知识边界,通过准确性和基于熵的置信度来优化各个区域的策略规划。在 ESCov 和 ExTES 数据集上使用多个 LLM 主干的实验表明,我们的方法优于基线,证实了该方法的有效性。
引用
@article{arxiv.2509.12661,
title = {Mitigating Strategy Preference Bias in Emotional Support Conversation via Uncertainty Estimations},
author = {Yougen Zhou and Qin Chen and Ningning Zhou and Jie Zhou and Xingjiao Wu and Liang He},
journal= {arXiv preprint arXiv:2509.12661},
year = {2025}
}