无视听:音视频描述中的模态偏置
音频与语音处理
2025-10-29 v1 计算机视觉与模式识别
图像与视频处理
摘要
音视频描述旨在通过联合建模声音和视觉信息生成整体场景描述。虽然近期方法通过精细的模态融合提升了性能,但目前音视频描述模型对两种模态互补性的程度以及在单一模态受损时鲁棒性仍不明确。我们通过在 LAVCap 上进行系统性模态鲁棒性测试来回答这些问题,其中我们选择性地抑制或损坏音频或视觉流,以量化灵敏度和互补性。分析结果显示,LAVCap 对音频流的偏好程度显著。为评估音视频描述模型在两模态使用是否平衡,我们扩展 AudioCaps,添加描述音频和视觉流的文本注释,形成 AudioVisualCaps 数据集。在实验中,我们报告了 LAVCap 在 AudioVisualCaps 上的 baseline 结果。我们也对 AudioVisualCaps 上的模型进行模态鲁棒性测试,结果表明,在 AudioVisualCaps 上训练的 LAVCap 相对于在 AudioCaps 上训练的 LAVCap 具有更少的模态偏置。
引用
@article{arxiv.2510.24024,
title = {Listening without Looking: Modality Bias in Audio-Visual Captioning},
author = {Yuchi Ishikawa and Toranosuke Manabe and Tatsuya Komatsu and Yoshimitsu Aoki},
journal= {arXiv preprint arXiv:2510.24024},
year = {2025}
}
备注
under review