中文

MoEScore:基于 Mixture-of-Experts 的文本-音频相关性得分预测用于文本到音频系统评估

声音 2026-01-13 v1

摘要

近期生成模型的进展使现代文本到音频(Text-to-Audio, TTA)系统能够合成高感知质量的音频。然而,TTA 系统往往难以保持与输入文本之间的语义一致性,导致声音事件、时间结构或情境关系出现不匹配。评估 TTA 中的语义忠实性仍是一个重大挑战。传统方法主要依赖主观的人类听觉测试,这耗时耗力。为此,我们提出一种基于 Mixture of Experts(MoE)架构的客观评估器,采用顺序交叉注意(Sequential Cross-Attention, SeqCoAttn)。我们的模型在 XACLE 挑战中取得了第一名,测试数据集上的 SRCC 为 0.6402(相较于挑战基线提升了 30.6%)。代码已公开:https://github.com/S-Orion/MOESCORE。

关键词

引用

@article{arxiv.2601.06829,
  title  = {MoEScore: Mixture-of-Experts-Based Text-Audio Relevance Score Prediction for Text-to-Audio System Evaluation},
  author = {Bochao Sun and Yang Xiao and Han Yin},
  journal= {arXiv preprint arXiv:2601.06829},
  year   = {2026}
}