用于长音频摘要的医患对话合成生成
声音
2026-04-08 v1 人工智能
摘要
长上下文音频推理在训练数据和评估方面均未得到充分服务。现有基准针对短上下文任务,而与长上下文推理最相关的开放生成任务对自动评估提出了众所周知的挑战。我们提出一种合成数据生成流水线,旨在同时作为训练资源和受控评估环境,并将其实例化为以 SOAP 记录生成为任务的首诊医患对话。该流水线包含三个阶段:基于人设的对话生成、多说话人音频合成(含重叠/停顿建模、房间声学和声音事件),以及基于开放权重大语言模型的参考 SOAP 记录生成。我们发布 8,800 条合成对话,包含 1.3k 小时的对应音频和参考记录。评估当前开放权重系统,我们发现级联方法仍然大幅优于端到端模型。
引用
@article{arxiv.2604.06138,
title = {Generating Synthetic Doctor-Patient Conversations for Long-form Audio Summarization},
author = {Yanis Labrak and David Grünert and Séverin Baroudi and Jiyun Chun and Pawel Cyrta and Sergio Burdisso and Ahmed Hassoon and David Liu and Adam Rothschild and Reed Van Deusen and Petr Motlicek and Andrew Perrault and Ricard Marxer and Thomas Schaaf},
journal= {arXiv preprint arXiv:2604.06138},
year = {2026}
}
备注
Submitted for review at Interspeech 2026