HEAR:面向视频对话的听觉增强音频响应
计算与语言
2025-04-15 v2 声音
音频与语音处理
摘要
视频对话旨在回答关于给定多模态输入(包括视频、音频和对话历史)的问题。尽管在开发 VGD 系统以提高其响应质量方面已有大量努力,但现有系统只能整合视频和文本中的信息,在生成对问题的适当响应时往往难以从音频中提取必要信息。VGD 系统似乎是聋的,因此我们将当前系统忽略音频数据的这种现象称为聋响应。为了克服聋响应问题,提出了听觉增强音频响应(HEAR)框架,通过在问题需要时选择性地关注音频来执行合理的倾听。HEAR 框架以模型无关的方式增强了 VGD 系统的准确性和可听性。HEAR 在 VGD 数据集(即 AVSD@DSTC7 和 AVSD@DSTC8)上得到了验证,并显示出对各种 VGD 系统的有效性。
引用
@article{arxiv.2312.09736,
title = {HEAR: Hearing Enhanced Audio Response for Video-grounded Dialogue},
author = {Sunjae Yoon and Dahyun Kim and Eunseop Yoon and Hee Suk Yoon and Junyeong Kim and Chnag D. Yoo},
journal= {arXiv preprint arXiv:2312.09736},
year = {2025}
}
备注
EMNLP 2023, 14 pages, 13 figures