中文

医疗对话的实时语音总结

计算与语言 2025-04-07 v2 人工智能 机器学习 声音 音频与语音处理

摘要

在医生与患者的对话中,识别医疗相关信息至关重要,这需要对对话进行总结。本文提出了首个面向实际应用的实时语音总结系统,能够在对话中的每个 N 句语音后生成局部摘要,并在对话结束后生成全局摘要。我们的系统从商业角度可以提升用户体验,从技术角度则能降低计算成本。其次,我们介绍了 VietMed-Sum,这是据称首个医疗对话语音总结数据集。最后,我们首次利用大语言模型和人类标注者协作创建医疗对话总结的金标准和合成摘要。我们还在 VietMed-Sum 上提供了最新模型的基线结果。所有代码、数据(英文翻译版和越南语)以及模型均已在线发布:https://github.com/leduckhai/MultiMed/tree/master/VietMed-Sum

关键词

引用

@article{arxiv.2406.15888,
  title  = {Real-time Speech Summarization for Medical Conversations},
  author = {Khai Le-Duc and Khai-Nguyen Nguyen and Long Vo-Dang and Truong-Son Hy},
  journal= {arXiv preprint arXiv:2406.15888},
  year   = {2025}
}

备注

Interspeech 2024 (Oral)