AudioMOS Challenge 2025的T12系统:基于KAN与VERSA模型的音频美学评分预测系统
声音
2026-02-03 v2 音频与语音处理
摘要
我们提出了由CyberAgent开发的音频美学评分(Audio Aesthetics Score, AES)预测系统,用于AudioMOS Challenge 2025(AMC25)Track 2。该AESCA系统包含一个基于Kolmogorov-Arnold网络(KAN)的音频盒美学预测器,以及一个使用VERSA工具包从度量分数进行预测的回归模型。在KAN-based预测器中,我们将基线模型中的每个多层感知器层替换为分组有理KAN,并使用有标签和伪标签音频样本训练模型。VERSA-based预测器被设计为使用极端梯度提升的回归模型,融合了现有度量的输出。KAN-based和VERSA-based模型均预测AES,包括四个评估轴。最终AES值通过结合四个KAN-based模型和一个VERSA-based模型的集成模型计算得出。我们提出的T12系统在三个轴上(utterance级别)、两个轴上(system级别)以及总体平均值上,在提交的所有系统中取得了最佳相关性。我们还发布了所提出的KAN-based预测器的推理模型(KAN #1-#4)。
引用
@article{arxiv.2512.05592,
title = {The T12 System for AudioMOS Challenge 2025: Audio Aesthetics Score Prediction System Using KAN- and VERSA-based Models},
author = {Katsuhiko Yamamoto and Koichi Miyazaki and Shogo Seki},
journal= {arXiv preprint arXiv:2512.05592},
year = {2026}
}
备注
Accepted to IEEE ASRU 2025. We also released the inference model of the proposed KAN-based predictor. https://github.com/CyberAgentAILab/aesca