中文

TM-PATHVQA:用于医学视觉问答的90000+无文本多语言问题

计算机视觉与模式识别 2024-07-17 v1 人工智能

摘要

在医疗保健和医学诊断中,视觉问答(VQA)在复杂医学图像分析对准确诊断至关重要的场景中可能成为关键工具。当前的基于文本的VQA系统限制了它们在执行任务时免提交互和可访问性至关重要的场景中的实用性。基于语音的VQA系统可能提供更好的交互方式,可以在执行任务的同时访问信息。为此,本工作通过引入无文本多语言病理VQA(TMPathVQA)数据集(PathVQA数据集的扩展)来实现基于语音的VQA系统,该数据集包含英语、德语和法语的语音问题。该数据集包含基于5,004张病理图像的98,397个多语言语音问题和答案,以及70小时的音频。最后,本工作对使用各种声学和视觉特征组合实现的TMPathVQA系统进行了基准测试和比较。

关键词

引用

@article{arxiv.2407.11383,
  title  = {TM-PATHVQA:90000+ Textless Multilingual Questions for Medical Visual Question Answering},
  author = {Tonmoy Rajkhowa and Amartya Roy Chowdhury and Sankalp Nagaonkar and Achyut Mani Tripathi},
  journal= {arXiv preprint arXiv:2407.11383},
  year   = {2024}
}

备注

conference (Accepted at Interspeech 2024)