面向跨模态通用性的非对称层次锚定:解决信息分配歧义
机器学习
2026-02-04 v1
摘要
面向跨模态通用性(CMG)的音视频联合表征学习旨在通过统一的离散表示空间将源模态知识传递到未标记的目标模态。现有对称框架常因缺乏结构归纳偏差而产生信息分配歧义,导致语义特定信息在模态之间泄漏。我们提出非对称层次锚定(AHA),通过在共享层次结构中指定结构化语义锚点来实现方向性信息分配。在实现中,我们利用音频残差向量量化(RVQ)引导的层次离散表征,将视频特征蒸馏到共享语义空间。为确保表征纯净,我们用基于GRL的对抗解耦器取代脆弱的互信息估计器,以显式抑制模态特定分支中的语义泄漏,并引入局部滑动对齐(LSA)以鼓励跨模态的细粒度时间对齐。在AVE和AVVP基准上的大量实验表明,AHA在跨模态迁移方面稳居对称基线之上。额外的 talking-face 解耦实验进一步验证,所学表征在语义一致性和解耦方面表现出更佳,凸显了该框架的更广泛适用性。
引用
@article{arxiv.2602.03570,
title = {Asymmetric Hierarchical Anchoring for Audio-Visual Joint Representation: Resolving Information Allocation Ambiguity for Robust Cross-Modal Generalization},
author = {Bixing Wu and Yuhong Zhao and Zongli Ye and Jiachen Lian and Xiangyu Yue and Gopala Anumanchipalli},
journal= {arXiv preprint arXiv:2602.03570},
year = {2026}
}
备注
18 pages, 11 figures