中文

TMU 系统用于 XACLE 挑战:基于 CLAP 伪标签训练大型音频语言模型

声音 2026-02-03 v1 音频与语音处理

摘要

本文提出一种针对 x-to-audio 对齐(XACLE)挑战的解决方案。该挑战旨在预测给定通用音频与文本对的语义对齐程度。我们提出的系统基于大型音频语言模型(LALM)架构。我们采用三阶段训练流程:自动音频字幕预训练、使用 CLAP 伪标签预训练、以及在 XACLE 数据集上微调。我们的实验表明,使用 CLAP 伪标签进行预训练是主要的性能驱动因素。在 XACLE 测试集上,我们的系统实现了 0.632 的 SRCC,显著优于基线系统(0.334),并在挑战队伍排名中获得第三名。代码和模型可在 https://github.com/shiotalab-tmu/tmu-xacle2026 找到。

关键词

引用

@article{arxiv.2602.00604,
  title  = {The TMU System for the XACLE Challenge: Training Large Audio Language Models with CLAP Pseudo-Labels},
  author = {Ayuto Tsutsumi and Kohei Tanaka and Sayaka Shiota},
  journal= {arXiv preprint arXiv:2602.00604},
  year   = {2026}
}

备注

3 pages; 2 figures; 2 tables; Accepted at ICASSP 2026 Workshop (SP Grand Challenges, GC-12: XACLE)