FreezeEmpath:基于冻结大语言模型的高效同理心 spoken chatbot 训练
计算与语言
2026-04-21 v1
摘要
同理心是培育自然交互在口语对话系统中至关重要的因素,因为它使机器能够识别人类语音的情感语气并提供同理心回复。近期研究在基于大语言模型(LLMs)的开发方面取得了显著进展,但在训练此类模型时仍面临若干挑战,包括依赖高成本的同理心语音指令数据以及生成语音缺乏情感表达。对 LLM 进行跨模态同理心指令数据微调可能还会导致灾难性遗忘并损害其通用能力。为应对这些挑战,我们提出了 FreezeEmpath,这是一种以简单高效方式训练的 end-to-end 同理心口语 chatbot。整个训练过程仅依赖现有的语音指令数据和语音情感识别(SER)数据,同时保持 LLM 参数的冻结状态。实验表明,FreezeEmpath 能够生成情感表达更强的语音,在同理心对话、SER 和 SpokenQA 任务中均优于其他同理心模型,展示了该训练策略的有效性。
引用
@article{arxiv.2604.18159,
title = {FreezeEmpath: Efficient Training for Empathetic Spoken Chatbots with Frozen LLMs},
author = {Yun Hong and Yan Zhou and Yang Feng},
journal= {arXiv preprint arXiv:2604.18159},
year = {2026}
}