中文

用于高质量音频字幕的无偏切片 Wasserstein 核

音频与语音处理 2026-02-27 v2 人工智能 机器学习

摘要

音频字幕系统面临一个根本性挑战:教师强制训练会产生暴露偏差,导致推理期间出现字幕退化。虽然已提出对抗方法作为解决方案,但它们通常无法捕捉声学模态与语言模态之间关键时序关系。我们通过引入无偏切片 Wasserstein RBF(USW-RBF)核配合旋转位置编码来解决这一限制,专为跨模态保留时序信息而设计。我们的方法具有实际优势:该核使其能够高效地进行随机梯度优化,使其在实际应用中具有可计算性。基于这一基础,我们开发了一个完整的音频字幕框架,集成随机解码以进一步缓解字幕退化。在 AudioCaps 和 Clotho 数据集上的大量实验表明,我们的方法显著提高了字幕质量、词汇多样性和文本到音频检索准确度。此外,我们展示了 USW-RBF 核的通用性,通过将其应用于音频推理任务,提升了大型音频语言模型在 CompA-R 推理能力,以正确性和质量为指标。我们的核也使 MMAU-test-mini 基准测试的推理准确率提高了 4%4\%。这些结果表明,我们的方法是跨模态对齐在音频语言任务中强大且通用的解决方案。

关键词

引用

@article{arxiv.2502.05435,
  title  = {Unbiased Sliced Wasserstein Kernels for High-Quality Audio Captioning},
  author = {Manh Luong and Khai Nguyen and Dinh Phung and Gholamreza Haffari and Lizhen Qu},
  journal= {arXiv preprint arXiv:2502.05435},
  year   = {2026}
}