基于音视频Transformer与联合师生学习的音视频场景感知对话及推理
计算与语言
2021-10-14 v1
摘要
在先前工作中,我们提出了音视频场景感知对话(AVSD)任务,收集了 AVSD 数据集,开发了 AVSD 技术,并在第 7 届与第 8 届对话系统技术挑战赛(DSTC7、DSTC8)中主办了 AVSD 挑战赛道。在这些挑战中,性能最优的系统严重依赖人工生成的视频内容描述,这些描述在数据集中可用,但在真实应用中并不可用。为推动面向真实应用的进一步进展,我们在 DSTC10 提出了第三项 AVSD 挑战,并做了两处修改:1)推理时不可用人工创建的描述;2)系统必须通过从视频中寻找证据支持每个答案来展示时序推理。本文介绍了包含时序推理的新任务,以及我们为 DSTC10 对 AVSD 数据集的新扩展,为此我们收集了人工生成的时序推理数据。我们还介绍了一个使用 AV-transformer 构建的基线系统,并与新数据集一同发布。最后,本文介绍了一种新系统,其通过注意力多模态融合、联合师生学习(JSTL)与模型组合技术扩展了我们的基线系统,在 DSTC7、DSTC8 与 DSTC10 的 AVSD 数据集上取得了最先进的性能。我们还提出了两种用于 AVSD 的时序推理方法:一种基于注意力,另一种基于时域区域提议网络。
引用
@article{arxiv.2110.06894,
title = {Audio-Visual Scene-Aware Dialog and Reasoning using Audio-Visual Transformers with Joint Student-Teacher Learning},
author = {Ankit P. Shah and Shijie Geng and Peng Gao and Anoop Cherian and Takaaki Hori and Tim K. Marks and Jonathan Le Roux and Chiori Hori},
journal= {arXiv preprint arXiv:2110.06894},
year = {2021}
}
备注
https://dstc10.dstc.community/home and https://github.com/dialogtekgeek/AVSD-DSTC10_Official/