中文

面向法国临床访谈的迭代式 LLM 增强语音转录与说话人分割

计算与语言 2026-05-21 v2 人工智能 声音 音频与语音处理

摘要

法语医疗对话的自动语音识别仍具挑战性,随机临床语音的词错误率常超过 30%。本研究提出一种多-pass LLM 后处理架构,在说话人识别与词识别之间交替,以提高转录准确度和说话人归属。针对两个法国临床数据集(自杀预防电话咨询和术前清醒脑外科手术咨询)进行消融研究,检验四个设计选择:模型选择、提示策略、pass 排序和迭代深度。使用 Qwen3-Next-80B, Wilcoxon 符号秩检验确认在自杀预防对话中显著降低 WDER (p<0.05, n=18),而在术前清醒脑外科咨询中保持稳定 (n=10),且无输出失败,计算成本可接受 (RTF 0.32),表明其在离线临床部署具有可行性,需在更大规模语料库上进一步验证。

关键词

引用

@article{arxiv.2603.00086,
  title  = {Iterative LLM-based improvement for French Clinical Interview Transcription and Speaker Diarization},
  author = {Ambre Marie and Thomas Bertin and Guillaume Dardenne and Gwenolé Quellec},
  journal= {arXiv preprint arXiv:2603.00086},
  year   = {2026}
}