ASK:自适应自改进音频文本检索知识框架
音频与语音处理
2026-03-25 v2 信息检索
机器学习
多媒体
声音
摘要
音频文本检索(ATR)的主导范式依赖于通过小批量对比学习优化的双编码器架构。然而,将优化限制在局部 batch 中的样本上会导致根本性限制,我们称之为梯度局域性瓶颈(GLB),该限制阻碍了声学模糊性的解决,并阻碍了稀有长尾概念的学习。虽然外部知识注入可以打破这一瓶颈,但常会引发称为表示漂移不匹配(RDM)的问题,即静态知识库与不断演化的编码器错位,导致指导退化为噪声。为解决这一相互交织的挑战,我们提出了自适应自改进知识(ASK)框架。ASK 通过多粒度知识注入打破 GLB,并通过动态精炼策略将知识库与模型同步,从而缓解 RDM。此外,采用自适应可靠性加权方案,基于跨模态一致性过滤检索噪声。广泛的实验表明,ASK 在各种主干网络上始终实现了新的状态最佳性能。
引用
@article{arxiv.2512.19703,
title = {ASK: Adaptive Self-improving Knowledge Framework for Audio Text Retrieval},
author = {Siyuan Fu and Xuchen Guo and Mingjun Liu and Hongxiang Li and Boyin Tan and Gongxi Zhu and Xianwei Zhuang and Jinghan Ru and Yuxin Xie and Yuguo Yin},
journal= {arXiv preprint arXiv:2512.19703},
year = {2026}
}