从音频学习视觉可 affordance
计算机视觉与模式识别
2025-12-30 v2
摘要
我们提出 Audio-Visual Affordance Grounding (AV-AG),是一个新的任务,用于从动作声音中分割对象交互区域。不同于依赖文本指令或演示视频的现有方法,这些方法常受限于模糊性或遮挡,音频提供了实时、语义丰富且与视觉独立的线索,使我们能够更直观地理解交互区域。为支持该任务,我们构建了第一个 AV-AG 数据集,包含大量动作声音、对象图像以及像素级可 affordance 标注。该数据集还包括一个未见子集,用于评估零样态泛化。此外,我们提出 AVAGFormer,一种配备语义条件跨模态混合器和双头解码器的模型,有效融合音频和视觉信号以进行掩码预测。实验表明,AVAGFormer 在 AV-AG 上取得了最新的性能,超越了来自相关任务的基线方法。综合分析强调了 AV-AG 与 AVS 之间的区别、端到端建模的优势以及每个组件的贡献。代码和数据集已发布于 https://jscslld.github.io/AVAGFormer/。
引用
@article{arxiv.2512.02005,
title = {Learning Visual Affordance from Audio},
author = {Lidong Lu and Guo Chen and Zhu Wei and Yicheng Liu and Tong Lu},
journal= {arXiv preprint arXiv:2512.02005},
year = {2025}
}
备注
15 pages, 10 figures