中文

OSUM-EChat:通过理解驱动的言语对话增强端到端同理心 spoken chatbot

声音 2025-09-04 v2

摘要

同理心是实现自然交互 within spoken dialogue systems 的关键, 允许机器识别和适当地响应包含年龄、性别和情感等 paralinguistic 线索. 最近的进展实现了语音语言模型的 end-to-end, 统一语音理解和生成, 提供了有前景的解决方案. 然而, 仍存在若干挑战, 包括对大规模对话数据集的过度依赖, 不足的从句法-语音线索中提取关键信息以传递同理心, 以及缺乏针对同理心的特定数据集和评估框架. 为了解决这些问题, 我们引入了OSUM-EChat, 这是一个开源的 end-to-end spoken dialogue system, 旨在增强资源受限环境中的同理心交互. OSUM-EChat 引入了两个关键创新: (1) 一个三阶段理解驱动的 spoken dialogue训练策略, 将大型语音理解模型的能力扩展到 spoken dialogue 任务; (2) 一个语言-句法双思考机制, 将句法理解通过链式思考与对话生成集成, 从而使系统能够产生更同理心的响应. 该方法减少了对大规模对话数据集的依赖, 同时保持高质量的同理心交互. 此外, 我们引入了EChat-200K 数据集, 一个丰富的同理心 speech-to-speech 对话语料库, 以及EChat-eval 基准, 一个用于评估对话系统同理心能力的全面框架. 实验结果表明, OSUM-EChat 在同理心响应方面优于 end-to-end spoken dialogue 模型, 验证了其有效性.

关键词

引用

@article{arxiv.2508.09600,
  title  = {OSUM-EChat: Enhancing End-to-End Empathetic Spoken Chatbot via Understanding-Driven Spoken Dialogue},
  author = {Xuelong Geng and Qijie Shao and Hongfei Xue and Shuiyuan Wang and Hanke Xie and Zhao Guo and Yi Zhao and Guojian Li and Wenjie Tian and Chengyou Wang and Zhixian Zhao and Kangxiang Xia and Ziyu Zhang and Zhennan Lin and Tianlun Zuo and Mingchen Shao and Yuang Cao and Guobin Ma and Longhao Li and Yuhang Dai and Dehui Gao and Dake Guo and Lei Xie},
  journal= {arXiv preprint arXiv:2508.09600},
  year   = {2025}
}