面向动态人类在回路 EQA 的记忆引导视图细化
计算机视觉与模式识别
2026-03-11 v1 多媒体
摘要
嵌入式问答(EQA)传统上是在时序稳定环境中进行评估的,其中视觉证据可以可靠地累积。然而,在动态、人类驻留的场景中,人类活动和遮挡引入了显著的感知非平稳性:任务相关线索是瞬时且视点依赖的,而存储再检索策略会过度累积冗余证据并增加推理成本。此设置暴露了 EQA 智能体的两个实际挑战:解决因视点依赖遮挡导致的歧义,以及保持紧凑且最新的证据以实现高效推理。为使此设置得到系统性研究,我们引入 DynHiL-EQA,一个包含两个子集的人类在回路 EQA 数据集:Dynamic 子集包含人类活动和时序变化,Static 子集包含时序稳定的观察。为解决上述挑战,我们提出 DIVRR(Dynamic-Informed View Refinement and Relevance-guided Adaptive Memory Selection),一个无训练框架,通过相关性引导的视图细化与选择性记忆录取相耦合。通过在提交之前验证模糊观察并仅保留信息丰富的证据,DIVRR 在遮挡下提高了鲁棒性,同时保持紧凑记忆的快速推理。在 DynHiL-EQA 和已建立的 HM-EQA 数据集上的大量实验表明,DIVRR 在动态和静态设置中均显著优于现有基线方法,同时保持高推理效率。
引用
@article{arxiv.2603.09541,
title = {Memory-Guided View Refinement for Dynamic Human-in-the-loop EQA},
author = {Xin Lu and Rui Li and Xun Huang and Weixin Li and Chuanqing Zhuang and Jiayuan Li and Zhengda Lu and Jun Xiao and Yunhong Wang},
journal= {arXiv preprint arXiv:2603.09541},
year = {2026}
}