中文

EDTC:增强自动音频描述中的文本理解深度

声音 2024-02-28 v1 音频与语音处理

摘要

模态差异一直在自动音频描述(AAC)及所有多模态领域构成重大挑战。促进模型理解文本信息对于建立文本和音频两种模态之间的无缝连接起着关键作用。虽然最近的研究侧重于通过对比学习缩小这两种模态之间的差距,但仅使用简单的对比损失来弥合两种模态之间的差异具有挑战性。本文介绍了增强文本理解深度(EDTC),该方法从三个不同角度增强了模型对文本信息的理解。首先,我们提出了一种新颖的融合模块 FUSER,旨在通过特征融合从不同的音频特征中提取共享语义信息。接着,我们引入了 TRANSLATOR,这是一种新颖的对齐模块,旨在在张量级别对齐音频特征和文本特征。最后,通过对孪生结构添加动量来更新权重,使模型能够同时学习两种模态的信息。所得方法在 AudioCaps 数据集上实现了最先进的性能,并在 Clotho 数据集上展示了与最先进方法相当的结果。

关键词

引用

@article{arxiv.2402.17259,
  title  = {EDTC: enhance depth of text comprehension in automated audio captioning},
  author = {Liwen Tan and Yin Cao and Yi Zhou},
  journal= {arXiv preprint arXiv:2402.17259},
  year   = {2024}
}