ReasonEdit:使用人类推理编辑视觉语言模型
计算机视觉与模式识别
2026-05-13 v4 人工智能
摘要
模型编辑旨在纠正大型预训练模型中的错误,而不影响其他不相关的行为。虽然最近的一些工作已编辑视觉语言模型(VLM),但现有编辑器都未针对需要人类和模型就图像进行推理的任务进行处理。我们因此提出了 ReasonEdit,这是第一个让用户在编辑期间解释其推理的 VLM 编辑器,引入一种新型、实用的模型编辑设置。ReasonEdit 持续存储人类推理信息,并在推理时仅检索相关事实,采用一种受网络科学启发的新型拓扑平衡多模态嵌入方法。我们在四个 VLM 上针对多个基于论证的视觉问答数据集进行测试,ReasonEdit 实现了状态的最佳编辑性能,最终表明在编辑期间使用人类推理可大幅提高编辑的泛化能力。
引用
@article{arxiv.2602.02408,
title = {ReasonEdit: Editing Vision-Language Models using Human Reasoning},
author = {Jiaxing Qiu and Kaihua Hou and Roxana Daneshjou and Ahmed Alaa and Thomas Hartvigsen},
journal= {arXiv preprint arXiv:2602.02408},
year = {2026}
}