带用户反馈的交互式情景记忆
计算机视觉与模式识别
2026-04-29 v1
摘要
在带自然语言查询的情景记忆(EM-NLQ)中,用户可能会提出需要搜索长时间内视角视频以查找答案的查询(例如“我把杯子放在哪里了?”)。然而,查询可能模糊不完整,导致错误响应。当前方法忽略了这一关键方面,以单次方式处理 EM-NLQ,限制了其在实际场景中的适用性。在本工作中,我们填补了这一差距,引入了带问题和反馈的情景记忆任务(EM-QnF)。在这里,用户可以对模型的初始预测提供反馈或添加更多信息(例如“此前。我在找大蓝色的杯子,而不是白色的”),帮助模型进行交互式细化。为此,我们收集了反馈基于交互的数据集,提出了轻量级的训练方案,避免了昂贵的顺序优化。我们还引入了一个即插即用的反馈对齐模块(FALM),使现有的 EM-NLQ 模型能够有效地整合用户反馈。我们的做法在三个具有挑战性的基准测试上显著优于当前最先进的方法,同时在保持高效的同时优于或与商业大型视觉语言模型相当。使用人类生成的反馈进行评估显示,我们的方法在现实场景中具有良好的概括能力。
引用
@article{arxiv.2604.24893,
title = {Interactive Episodic Memory with User Feedback},
author = {Nikesh Subedi and Loris Bazzani and Ziad Al-Halah},
journal= {arXiv preprint arXiv:2604.24893},
year = {2026}
}
备注
Accepted to CVPR 2026. Project Page: https://nsubedi11.github.io/refocus