迈向多语言视听问答
机器学习
2024-06-14 v1 计算机视觉与模式识别
多媒体
声音
音频与语音处理
摘要
在本文中,我们致力于将视听问答(AVQA)扩展到多语言环境。现有的AVQA研究主要围绕英语展开,将其复制到其他语言以解决AVQA问题需要大量的资源分配。作为一种可扩展的解决方案,我们利用机器翻译,并基于现有的基准AVQA数据集,为八种语言创建了两个多语言AVQA数据集。这避免了手动收集问题和答案的额外人工标注工作。为此,我们提出了MERA框架,通过利用最先进的视频、音频和文本基础模型来实现多语言AVQA。我们引入了一系列模型,即MERA-L、MERA-C、MERA-T,它们具有不同的模型架构,用于对所提出的数据集进行基准测试。我们相信,我们的工作将开辟新的研究方向,并作为未来多语言AVQA研究的参考基准。
引用
@article{arxiv.2406.09156,
title = {Towards Multilingual Audio-Visual Question Answering},
author = {Orchid Chetia Phukan and Priyabrata Mallick and Swarup Ranjan Behera and Aalekhya Satya Narayani and Arun Balaji Buduru and Rajesh Sharma},
journal= {arXiv preprint arXiv:2406.09156},
year = {2024}
}
备注
Accepted to Interspeech 2024