中文

将 VLM 助手与个性化情境认知对齐

人工智能 2025-06-03 v1 计算与语言

摘要

与一般人类目标(例如无害和无幻觉)对齐的视觉语言模型(VLM)已成为人类管理视觉任务的有价值助手。然而,具有不同背景的人即使在相同情境下也会有不同的认知。因此,他们可能对 VLM 助手有个性化的期望。这突显了将 VLM 助手与个性化情境认知对齐以用于现实世界辅助的迫切需求。为了研究这个问题,我们首先通过基于社会学概念“角色集”(Role-Set)刻画个体来简化它。然后,我们提出评估个体的行动,以检验是否实现了个性化对齐。进一步,我们构建了一个名为 PCogAlignBench 的基准,其中包含 18k 个实例和 20 个具有不同角色集的个体。最后,我们提出了一个名为 PCogAlign 的框架,该框架构建了一个用于个性化对齐的认知感知和基于行动的奖励模型。实验结果和人类评估证明了 PCogAlignBench 的可靠性以及我们提出的 PCogAlign 的有效性。我们将在 https://github.com/NLPGM/PCogAlign 开源构建的基准和代码。

关键词

引用

@article{arxiv.2506.00930,
  title  = {Aligning VLM Assistants with Personalized Situated Cognition},
  author = {Yongqi Li and Shen Zhou and Xiaohu Li and Xin Miao and Jintao Wen and Mayi Xu and Jianhao Chen and Birong Pan and Hankun Kang and Yuanyuan Zhu and Ming Zhong and Tieyun Qian},
  journal= {arXiv preprint arXiv:2506.00930},
  year   = {2025}
}

备注

Accepted to ACL 2025 (main), camera-ready version