面向阶段性音视频学习的迟延承诺表征准备度
声音
2026-05-05 v1 多媒体
摘要
阶段性音视频编码器传递融合的中间状态跨越层级,使得后续表征的形成依赖于早期融合状态的准备就绪。强烈的局部音视频一致性提供了有用的对应证据,但融合状态也需要充足的跨层级和跨模态支持,才能可靠地指导后续融合。本文通过传播感知的表征准备度研究此问题,并将过早的感知承诺表述为准备度不足的问题,其中局部可信度、传播影响和支持不足在中间阶段共同呈现。我们提出迟延感知承诺网络(DPC-Net),一种编码器层面的框架,估计可观测的准备度不足代理物,定位干预敏感的瓶颈,并应用跨层级和跨模态证据进行支持感知的纠正。DPC-Net保留任务特定的头部、损失、解码模块和评估协议,使其可通过编码器侧干预应用于不同的音视频任务。实验在音视频语音分离、音视频事件定位和音视频语音识别上显示,在重构、定位和识别 regime中均一致改进。进一步的分析包括组件贡献、选择准则、反事实干预和准备度轨迹,支持了准备度引导的瓶颈纠正的有效性。
引用
@article{arxiv.2605.01673,
title = {Delayed Commitment for Representation Readiness in Stage-wise Audio-Visual Learning},
author = {Xinmeng Xu and Haoran Xie and S. Joe Qin and Lin Li and Xiaohui Tao and Fu Lee Wang},
journal= {arXiv preprint arXiv:2605.01673},
year = {2026}
}