中文

探索 ChatGPT 在病理语音检测中的类因果学习能力

音频与语音处理 2025-04-01 v1 声音

摘要

自动病理语音检测方法已显示出有前景的成果, 正受到关注, 作为潜在诊断工具伴随高昂的传统方法。虽然这些方法可实现高准确率,但其解释性不足限制了在临床实践中的应用。在本文中, 我们研究了使用多模态大型语言模型(LLM), 具体为 ChatGPT-4o, 在 few-shot 类因果学习 setting下进行自动病理语音检测的可能性。实验结果表明, 该方法不仅交付了有前景的性能, 还为其决策提供了解释, 增强了模型的解释性。为进一步理解其有效性, 我们进行了消融研究以分析不同因素(如输入类型和系统提示词)对最终结果的影响。我们的发现突显了多模态 LLM 在自动病理语音检测领域的潜力, 为该领域的进一步探索和发展指明了方向。

关键词

引用

@article{arxiv.2503.23873,
  title  = {Exploring In-Context Learning Capabilities of ChatGPT for Pathological Speech Detection},
  author = {Mahdi Amiri and Hatef Otroshi Shahreza and Ina Kodrasi},
  journal= {arXiv preprint arXiv:2503.23873},
  year   = {2025}
}

备注

submitted to EUSIPCO 2025