中文

寻求通用短片语言理解解决方案

机器学习 2026-03-20 v1

摘要

短片语言理解(Shot Language Understanding, SLU)是电影分析中的关键任务,但由于其涉及多样化的摄影维度和主观的专家判断,仍面临挑战。虽然视觉语言模型(vision-language models, VLMs)在通用视觉理解方面表现出强大能力,但近期研究揭示了VLMs在SLU任务上与电影专家之间存在判决差异。为弥合这一差距,我们引入了SLU-SUITE——一个包含49万人工标注的问答对的综合性训练与评估套件,覆盖33项任务,涵盖六个电影相关维度。通过SLU-SUITE,我们首次观察到两种关于基于VLM的SLU的见解:从模型层面诊断出模块的关键瓶颈;从数据层面量化了任务之间跨维度的影响。这些发现激发了我们两种互补范式的通用SLU解决方案:UniShot——通过动态平衡数据混合训练的均衡型通用泛化模型;AgentShots——一种通过提示路由专家集群以最大化峰值维度性能的模型。大量实验表明,我们的模型在域内任务上超越任务特定的集成模型,在域外任务上超越领先商业VLMs高出22%。

关键词

引用

@article{arxiv.2603.18448,
  title  = {Seeking Universal Shot Language Understanding Solutions},
  author = {Haoxin Liu and Harshavardhan Kamarthi and Zhiyuan Zhao and Hongjie Chen and B. Aditya Prakash},
  journal= {arXiv preprint arXiv:2603.18448},
  year   = {2026}
}