超越语言的响应:面向真实用户意图的视频生成基准
人工智能
2025-06-03 v1 计算与语言
摘要
查询生成式 AI 模型(例如大型语言模型(LLM))已成为获取信息的普遍方法。然而,现有的问答数据集主要关注文本响应,这使得应对需要视觉演示或解释以便更好理解的复杂用户查询变得困难。为了弥合这一差距,我们构建了一个基准 RealVideoQuest,旨在评估文本到视频(T2V)模型回答真实世界中基于视觉的查询的能力。该基准从 Chatbot-Arena 中识别出 7.5K 个具有视频响应意图的真实用户查询,并通过多阶段视频检索与优化过程构建了 4.5K 个高质量的查询-视频对。我们进一步开发了一个多角度评估系统,以评估生成的视频回答的质量。实验表明,当前的 T2V 模型在有效应对真实用户查询方面存在困难,这指出了多模态 AI 中的关键挑战和未来研究机遇。
引用
@article{arxiv.2506.01689,
title = {Respond Beyond Language: A Benchmark for Video Generation in Response to Realistic User Intents},
author = {Shuting Wang and Yunqi Liu and Zixin Yang and Ning Hu and Zhicheng Dou and Chenyan Xiong},
journal= {arXiv preprint arXiv:2506.01689},
year = {2025}
}