中文

面向前线健康对话的语音系统基准测试:DISPLACE-M 挑战

音频与语音处理 2026-03-06 v3

摘要

DIarization and Speech Processing for LAnguage understanding in Conversational Environments - Medical (DISPLACE-M) 挑战引入了用于理解以目标为导向的真实世界医疗对话的对话式 AI 基准测试。该挑战涉及前线健康工作者与求助者之间多语者互动,特点是语音自发、嘈杂且重叠。在本挑战期间,发布了由 40 小时开发数据和 15 小时盲评录音组成的医疗对话数据集。我们提供了跨 4 个任务的基线系统——说话人分割、自动语音识别、主题识别和对话摘要——以实现一致的基准测试。系统性能使用说话人分割错误率 (DER)、时间受限最小置换词错误率 (tcpWER) 和 ROUGE-L 进行评估。本文描述了 Phase-I 评估——数据、任务和基线系统——以及评估结果概述。

关键词

引用

@article{arxiv.2603.02813,
  title  = {Benchmarking Speech Systems for Frontline Health Conversations: The DISPLACE-M Challenge},
  author = {Dhanya E and Ankita Meena and Manas Nanivadekar and Noumida A and Victor Azad and Ashwini Nagaraj Shenoy and Pratik Roy Chowdhuri and Shobhit Banga and Vanshika Chhabra and Chitralekha Bhat and Shareef babu Kalluri and Srikanth Raj Chetupalli and Deepu Vijayasenan and Sriram Ganapathy},
  journal= {arXiv preprint arXiv:2603.02813},
  year   = {2026}
}

备注

Submitted for review to Interspeech 2026