Omni-Judge: Omni-LLMs 是否可作为文本条件音视频生成的人类对齐评判器
计算机视觉与模式识别
2026-02-03 v1
摘要
Sora 2和Veo 3等最先进的文本到视频生成模型现在能够直接从文本提示生成高保真视频并同步音频,标志着多模态生成的新里程碑。然而,评估此类三模态输出仍是未解之谜。人类评估可靠但成本高昂且难以规模化,而传统自动指标如FVD、CLAP和ViCLIP专注于孤立模态间,对复杂提示支持不足且解释力有限。多模态大语言模型 (omni-LLMs) 作为有潜力的替代方案:它们自然地处理音频、视频和文本,支持丰富推理,提供可解释的链式思考反馈。基于此,我们引入Omni-Judge,评估omni-LLMs是否可作为文本条件音视频生成的人类对齐评判器。跨越九个感知和对齐指标,Omni-Judge的相关性相当于传统指标,尤其在语义密集型任务(如音频-文本对齐、视频-文本对齐和音频-视频-文本一致性)中表现突出。在高帧率感知指标(包括视频质量和音视频同步)方面表现不足,这源于时间分辨率的局限。Omni-Judge提供可解释的解释,揭示语义或物理不一致,支持反馈驱动的后续应用,如基于反馈的精细调整。我们的发现凸显了omni-LLMs作为统一多模态生成评估器的潜力及其当前局限性。
关键词
引用
@article{arxiv.2602.01623,
title = {Omni-Judge: Can Omni-LLMs Serve as Human-Aligned Judges for Text-Conditioned Audio-Video Generation?},
author = {Susan Liang and Chao Huang and Filippos Bellos and Yolo Yunlong Tang and Qianxiang Shen and Jing Bi and Luchuan Song and Zeliang Zhang and Jason Corso and Chenliang Xu},
journal= {arXiv preprint arXiv:2602.01623},
year = {2026}
}