$C^3$:面向视频 grounding 对话的组合式反事实对比学习
机器学习
2023-08-08 v2 计算与语言
计算机视觉与模式识别
摘要
视频 grounding 对话系统旨在融合视频理解与对话理解,以生成与对话及视频上下文均相关的回复。现有多数方法采用深度学习模型,并在相对较小的数据集上取得显著性能。然而,这些结果部分源于利用数据集偏差而非发展多模态推理,导致泛化能力有限。本文提出一种新颖的组合式反事实对比学习(Compositional Counterfactual Contrastive Learning, )方法,在视频 grounding 对话中构建事实与反事实样本间的对比训练。具体而言,我们基于视频时间步与对话词元设计事实/反事实采样,并提出利用对象级或动作级方差的对比损失函数。与先前方法不同,我们聚焦于组合输出词元间隐藏状态表示的对比,以在生成设定中优化表示空间。我们在音视觉场景感知对话(Audio-Visual Scene-Aware Dialogues, AVSD)基准上取得可观性能提升,并展示了该方法在 grounding 视频与对话上下文方面的优势。
引用
@article{arxiv.2106.08914,
title = {$C^3$: Compositional Counterfactual Contrastive Learning for Video-grounded Dialogues},
author = {Hung Le and Nancy F. Chen and Steven C. H. Hoi},
journal= {arXiv preprint arXiv:2106.08914},
year = {2023}
}
备注
24th Meeting of the Special Interest Group on Discourse and Dialogue (SIGDIAL)