中文

MMedFD:面向多轮全双工自动语音识别的真实医疗基准测试

音频与语音处理 2025-09-29 v2

摘要

临床对话中的自动语音识别(ASR)需要应对全双工交互、说话人重叠和低延迟约束,但公开基准仍然稀缺。我们提出MMedFD,这是首个面向多轮全双工设置的真实中文医疗ASR语料库。该数据集来自已部署的AI助手,包含5,805个标注会话,附带同步的用户视角和混合信道视角、RTTM/CTM时间标注及角色标签。我们提出了一种模型无关的流水线,用于流式分割、说话人归属和对话记忆,并在角色拼接音频上微调Whisper-small以实现长上下文识别。ASR评估包括WER、CER和HC-WER,后者在医疗场景中衡量概念级准确率。LLM生成的回答通过基于评分标准和成对比较协议进行评估。MMedFD为基准测试流式ASR和医疗部署中的端到端双工智能体建立了可复现的框架。数据集及相关资源在https://github.com/Kinetics-JOJO/MMedFD公开获取。

关键词

引用

@article{arxiv.2509.19817,
  title  = {MMedFD: A Real-world Healthcare Benchmark for Multi-turn Full-Duplex Automatic Speech Recognition},
  author = {Hongzhao Chen and XiaoYang Wang and Jing Lan and Hexiao Ding and Yufeng Jiang and MingHui Yang and DanHui Xu and Jun Luo and Nga-Chun Ng and Gerald W. Y. Cheng and Yunlin Mao and Jung Sun Yoo},
  journal= {arXiv preprint arXiv:2509.19817},
  year   = {2025}
}