迭代残差交叉注意力机制:面向音视频导航任务的集成方法
人工智能
2025-10-01 v1 多媒体
声音
摘要
音视频导航是智能代理利用自我中心视觉和听觉感知来识别音频目标的重要研究领域。传统导航方法通常采用分阶段模块化设计,先执行特征融合,然后利用门控循环单元(GRU)进行序列建模,最后通过强化学习做出决策。虽然这种模块化方法已显示有效,但也可能导致冗余的信息处理,以及在特征融合和GRU序列建模阶段之间信息传输的不一致。本文提出IRCAM-AVN(Iterative Residual Cross-Attention Mechanism for Audiovisual Navigation),一个集成音视频信息融合和序列建模于统一IRCAM模块的端到端框架,取代传统的分离融合和GRU组件。这种创新机制采用多层残差设计,将初始多模态序列与处理后的信息序列拼接。这种方法论的转变在逐步优化特征提取过程的同时,减少了模型偏差,增强了模型的稳定性和泛化能力。实证结果表明,采用迭代残差交叉注意力机制的智能代理在导航任务中表现出优越的性能。
引用
@article{arxiv.2509.25652,
title = {Iterative Residual Cross-Attention Mechanism: An Integrated Approach for Audio-Visual Navigation Tasks},
author = {Hailong Zhang and Yinfeng Yu and Liejun Wang and Fuchun Sun and Wendong Zheng},
journal= {arXiv preprint arXiv:2509.25652},
year = {2025}
}
备注
Accepted for publication by IEEE International Conference on Systems, Man, and Cybernetics 2025