中文

面向中文游戏领域的短视频帧检索多模态知识密集基准——SVFSearch

组合数学 2026-05-19 v1

摘要

多模态大语言模型日益被用作理解多模态输入、规划检索动作、调用外部工具并对检索信息进行推理的智能体核心。然而,现有基准很少评估此类能力于短视频应用,因暂停帧常视觉模糊,回答需要垂直、长尾且快速演化的领域知识。我们引入SVFSearch——首个开放的中文游戏领域短视频帧检索基准。SVFSearch包含5000个四选项测试样例和4198个辅助训练样例,每个样例均来自真实短视频剪辑中暂停的游戏场景。为支持公平且可复现的评估,SVFSearch提供冻结的离线检索环境,包含游戏领域文本语料库、主题链接图像画廊以及文本、图像和多模态检索接口,避免依赖不可控的网络搜索API。我们评估了从直接问答、RAG工作流到Plan-Act-Replan智能体以及学习搜索模型的代表性方法。结果揭示了模型单纯问答、实际智能体搜索与准确知识之间的巨大差距:最佳开源直接问答模型达66.4%,最佳实际智能体达79.1%,而准确知识达95.4%。进一步分析暴露了视觉 grounding、检索质量、证据驱动推理和工具使用行为中的瓶颈,包括过度搜索、仅答案捷径和检索诱导误导等问题。

关键词

引用

@article{arxiv.2605.17945,
  title  = {Note on the codegree version of the Erd\H{o}s--Ko--Rado theorem},
  author = {Luyining Gan and Jie Han and Seonghyuk Im},
  journal= {arXiv preprint arXiv:2605.17945},
  year   = {2026}
}

备注

10 pages