中文

医疗领域零样本端到端口头问答

计算与语言 2024-06-11 v1 机器学习 声音 音频与语音处理

摘要

在口头问答 (SQA) 快速演变的背景下,大语言模型 (LLM) 的集成已成为一种变革性的发展。传统方法通常需要为问题音频转录和答案选择分别使用多个模型,导致显著的资源消耗和错误累积。为克服这些挑战,我们探讨了在医疗领域使用端到端 (E2E) 方法进行 SQA 的有效性。我们的研究引入了一种新的零样本 SQA 方法,与传统级联系统进行比较。通过在新的开放基准数据集上进行全面评估(包含 8 个医疗任务和 48 小时合成音频),我们展示了该方法相较于组合 130 亿参数 LLM 和 15.5 亿参数 ASR 模型,所需资源最多减少 14.7 倍,同时将平均准确率提升 0.5%。这些发现凸显了在资源受限的上下文中 E2E 方法为 SQA 具有巨大的潜力。

关键词

引用

@article{arxiv.2406.05876,
  title  = {Zero-Shot End-To-End Spoken Question Answering In Medical Domain},
  author = {Yanis Labrak and Adel Moumen and Richard Dufour and Mickael Rouvier},
  journal= {arXiv preprint arXiv:2406.05876},
  year   = {2024}
}

备注

Accepted to INTERSPEECH 2024