通过分层跨模态交互与辅助字幕改进音频-文本检索
声音
2025-05-06 v2 音频与语音处理
摘要
大多数现有的音频-文本检索(ATR)方法侧重于在整段音频片段与完整字幕句子之间构建对比对,而忽略了细粒度跨模态关系,例如短片段与短语或帧与词之间的关系。本文中,我们引入一种用于 ATR 的分层跨模态交互(HCI)方法,通过同时探索片段-句子、段-短语和帧-词关系,实现全面的多模态语义比较。此外,我们还提出了一种新颖的 ATR 框架,利用预训练字幕生成器生成的辅助字幕(AC)来执行音频与生成字幕之间的特征交互,从而产生增强的音频表示,并与原始 ATR 匹配分支互补。音频与生成字幕也可形成新音频-文本对作为训练数据增强。实验表明,我们的 HCI 显著提升了 ATR 性能。此外,我们的 AC 框架在多个数据集上也展现出稳定的性能增益。
引用
@article{arxiv.2307.15344,
title = {Improving Audio-Text Retrieval via Hierarchical Cross-Modal Interaction and Auxiliary Captions},
author = {Yifei Xin and Yuexian Zou},
journal= {arXiv preprint arXiv:2307.15344},
year = {2025}
}
备注
Accepted by Interspeech2023