BoxTuning:用于多模态模型微调的对象框直接注入
计算机视觉与模式识别
2026-04-14 v1 人工智能
摘要
对象级别的时空理解是视频问答的关键,但现有的多模态大语言模型(MLLM)对帧进行整体编码,缺乏对对象精细 grounding 的显式机制。最近的工作通过将边界框坐标序列化为文本标记来解决此问题,但这种文本坐标范式存在根本性模态不匹配:对象信息本质上是视觉的,然而将其编码为文本会产生高token成本,迫使进行激进的时序下采样。我们提出BoxTuning,通过将对象时空信息直接注入视觉模态来解决此问题。将彩色边界框和轨迹痕迹渲染到视频帧上作为视觉提示,仅保留简洁的颜色到对象图例作为文本。这种做法显著降低了token成本,实际应用中实现了87-93%的文本token降低。它还保持了完整的时序分辨率,其中轨迹痕迹进一步在每个关键帧中编码了帧间运动方向和速度,恢复了文本坐标方法被迫丢弃的细粒度动力学。在CLEVRER、Perception Test、STAR、NExT-QA、IntentQA等五个视频QA基准测试上的实验结果表明,BoxTuning在空间导向任务上超越文本坐标基线,并几乎消除了在推理导向任务上观察到的准确率下降,确立了视觉提示作为向视频MLLM传递对象信息的更自然且更高效的范式。
关键词
引用
@article{arxiv.2604.11136,
title = {BoxTuning: Directly Injecting the Object Box for Multimodal Model Fine-Tuning},
author = {Zekun Qian and Ruize Han and Wei Feng},
journal= {arXiv preprint arXiv:2604.11136},
year = {2026}
}