中文

层次化跨模态融合能否预测人类对AI配音内容的感知?

音频与语音处理 2026-04-27 v2

摘要

评估AI生成配音内容是 inherently 多维的,受synchronization、intelligibility、speaker consistency、emotional alignment和semantic context的影响。人类Mean Opinion Scores(MOS)仍是金标准,但成本高昂且难以大规模应用。我们提出了一种用于感知上有意义的配音评估的层次化多模态架构,整合来自audio、video和text的互补线索。该模型捕获细粒度特征,如speaker identity、prosody和content来自audio,facial expressions和scene-level cues来自video以及semantic context来自text,这些特征通过intra和inter模态层逐步融合。轻量级LoRA适配器实现跨模态的参数高效微调。为克服有限主观标签, 我们通过active learning推导代理MOS,将客观指标加权求和。该方法在12k段印地语-英语双向配音剪辑上进行训练,随后进行人类MOS的微调。我们的做法实现了强大的感知对齐(PCC > 0.75),为AI配音内容的自动评估提供了可扩展解决方案。

关键词

引用

@article{arxiv.2603.28717,
  title  = {Can Hierarchical Cross-Modal Fusion Predict Human Perception of AI Dubbed Content?},
  author = {Ashwini Dasare and Nirmesh Shah and Ashishkumar Gudmalwar and Pankaj Wasnik},
  journal= {arXiv preprint arXiv:2603.28717},
  year   = {2026}
}

备注

Accepted at ICASSP 2026