学习拒绝:基于强化微调的视频时间定位中的拒绝感知
计算机视觉与模式识别
2025-12-01 v1
摘要
视频时间定位 (VTG) 旨在在视频中定位与自然语言查询相对应的时间段。然而,现有的 VTG 模型假设相关片段总是存在,导致它们总是预测目标片段,即使查询与视频无关。虽然最近的方法试图处理无关查询,但只能拒绝与视频完全不相关的查询,仍无法处理语义相似但实际上不相关的硬性无关查询。为此,我们提出了拒绝感知强化微调 (RA-RFT) 以有效处理 VTG 中的硬性无关查询。我们的方法基于组相对策略优化 (GRPO) 框架,集成四个奖励目标——格式化、拒绝-IoU、解释和查询纠正——以提高相关性判别和细粒度语义推理能力。此外,为有效支持 RA-RFT,我们构建了一个硬性无关 VTG (HI-VTG) 数据集,包含硬性无关查询及其拒绝答案。我们在各种相关性感知 VTG 场景中展示了该方法的有效性,包括硬性无关 VTG、简单混洗 RA-VTG 和人工标注 RA-VTG 设置。我们还表明该方法具有可扩展性,可应用于 various LVLM-based VTG 模型。我们的代码已在 https://github.com/JINSUBY/RA-RFT 上公开。
引用
@article{arxiv.2511.23151,
title = {Learning to Refuse: Refusal-Aware Reinforcement Fine-Tuning for Hard-Irrelevant Queries in Video Temporal Grounding},
author = {Jin-Seop Lee and SungJoon Lee and SeongJun Jung and Boyang Li and Jee-Hyong Lee},
journal= {arXiv preprint arXiv:2511.23151},
year = {2025}
}
备注
19 pages