中文

基于注意力机制的音频问答方法

计算与语言 2023-06-01 v1 机器学习 声音 音频与语音处理

摘要

音频问答(AQA)是指在给定音频和自然语言问题的情况下,系统生成自然语言答案的任务。本文中,我们提出了基于自注意力(self-attention)和交叉注意力(cross-attention)的神经网络架构用于 AQA 任务。自注意力层提取强大的音频和文本表示。交叉注意力将文本特征相关的音频特征映射以生成答案。我们所有的模型均在近期提出的 Clotho-AQA 数据集上训练,涵盖二值 yes/no 问题和单词答案问题。我们的结果明显优于原论文中报告的参考方法。在 yes/no 二分类任务上,我们提出的模型准确率为 68.3%,而参考模型为 62.7%。对于单词答案多分类器,我们的模型 top-1 和 top-5 准确率分别为 57.9% 和 99.8%,而参考模型分别为 54.2% 和 93.7%。我们进一步讨论了 Clotho-AQA 数据集中的一些挑战,例如同一答案词以多种时态、单复数形式出现,以及对同一问题存在具体和通用答案。我们解决了这些问题并给出了该数据集的修订版本。

关键词

引用

@article{arxiv.2305.19769,
  title  = {Attention-Based Methods For Audio Question Answering},
  author = {Parthasaarathy Sudarsanam and Tuomas Virtanen},
  journal= {arXiv preprint arXiv:2305.19769},
  year   = {2023}
}