中文

语音与歌唱服务的契约驱动 QoE 审计:从 MOS 回归到服务图

声音 2025-12-05 v1 机器学习

摘要

主观平均意见分(MOS)仍然是非侵入式语音和歌唱质量评估的事实标准目标。然而,MOS 是一个标量,它压缩了异构的用户期望,忽略了服务级目标,并且难以跨部署图进行比较。我们提出了一种契约驱动的 QoE 审计框架:每个服务图 G 在一组人类可解释的体验契约 C 下进行评估,产生一个契约级满意度向量 Q(G, C)。我们表明:(i) 经典 MOS 回归是具有退化契约集的特例;(ii) 在图视图变换(例如,按系统与按系统类型进行池化)下,契约驱动的质量比 MOS 更稳定;(iii) 学习契约的有效样本复杂度由契约语义决定,而不仅仅是 C 的维度。我们在 URGENT2024 MOS(6.9k 条带原始评分向量的语音话语)和 SingMOS v1(7,981 个歌唱片段;80 个系统)上实例化了该框架。在 URGENT 上,我们在自监督 WavLM 嵌入上训练了一个契约感知的神经审计器;在 SingMOS 上,我们使用发布的评分向量和元数据(不解码音频)执行契约驱动的图审计。实验上,我们的审计器在 MOS 准确性上与强 MOS 预测器相匹配,同时提供校准的契约概率;在 SingMOS 上,Q(G, C) 表现出比原始 MOS 和仅图基线小得多的跨视图漂移;在 URGENT 上,难度曲线揭示,错误指定的“简单”契约可能比更丰富但对齐更好的契约集更难学习。

关键词

引用

@article{arxiv.2512.04827,
  title  = {Contract-Driven QoE Auditing for Speech and Singing Services: From MOS Regression to Service Graphs},
  author = {Wenzhang Du},
  journal= {arXiv preprint arXiv:2512.04827},
  year   = {2025}
}

备注

11 pages, 3 figures