中文

VocalAgent:面向声学健康诊断的大语言模型及安全评估

声音 2025-09-29 v3 人工智能 音频与语音处理

摘要

声学健康在人们的生活中占据重要位置,显著影响其沟通能力和相互作用。尽管全球范围内存在许多语音障碍,但许多人缺乏便捷的诊断和治疗手段。本文介绍 VocalAgent,一个用于声学健康诊断的音频大语言模型 (LLM)。我们利用在医院患者现场收集的三个数据集上微调的 Qwen-Audio-Chat 模型,并提出多维度评估框架,包括安全评估以缓解诊断偏见、跨语言性能分析和模态消失研究。VocalAgent 在语音障碍分类方面优于基于最新基线的方法。其 LLM 方法提供了一个可扩展的解决方案,用于更广泛地采用健康诊断,同时强调了伦理和技术验证的重要性。

关键词

引用

@article{arxiv.2505.13577,
  title  = {VocalAgent: Large Language Models for Vocal Health Diagnostics with Safety-Aware Evaluation},
  author = {Yubin Kim and Taehan Kim and Wonjune Kang and Eugene Park and Joonsik Yoon and Dongjae Lee and Xin Liu and Daniel McDuff and Hyeonhoon Lee and Cynthia Breazeal and Hae Won Park},
  journal= {arXiv preprint arXiv:2505.13577},
  year   = {2025}
}

备注

Accepted by Proceedings of Interspeech 2025; Website: https://han811.github.io/VocalAgent2025/