基于结构保持与信息平衡的联合中心双对比对齐
材料科学
2026-04-20 v1
摘要
我们提出了HILBERT(HIerarchical Long-sequence Balanced Embedding with Reciprocal contrastive Training),一个用于从低资源数据中的长分段序列中学习文档级音频-文本表示的交叉注意力多模态框架。HILBERT利用冻结的预训练语音和语言编码器提取分段级特征,通过交叉模态注意力和自注意力池化聚合,形成各模态的文档表示和联合交叉注意力嵌入。为了在严重的音频-文本维度不平衡下对模态进行对齐,同时保持模态特定的结构,我们引入一种互为对照的双对比目标,同时对音频到联合和文本到联合表示进行对齐,而不是直接对音频和文本进行对照。两个辅助正则化器进一步稳定长序列融合:一种是Centered Kernel Alignment(CKA)损失,用于保持每个模态与联合嵌入之间的结构一致性;另一种是互信息平衡损失,用于防止单一模态主导,通过在平等地将音频和文本的信息流导入联合空间来实现。对于下游预测,HILBERT采用 Mixture-of-Experts(MoE)分类器对拼接后的音频、文本和联合表示进行分类,以适应异构的标签场景。广泛的评估表明,HILBERT学习了有意义的长序列表示,并在高度不平衡的多类设置中实现了卓越的性能。
引用
@article{arxiv.2604.16246,
title = {Bridging Atomistic and Continuum Descriptions of Nanoscale Dislocation Loops in Tungsten},
author = {Joseph Duque Lopez and Sergei Dudarev and James Kermode and Thomas Hudson},
journal= {arXiv preprint arXiv:2604.16246},
year = {2026}
}