MPCI-Bench:用于语言模型代理多模态成对情境完整性评估的基准
人工智能
2026-01-27 v3 计算与语言
摘要
随着语言模型代理从被动聊天机器人发展为处理个人数据的主动助手,评估其遵守社会规范的能力变得越来越关键,常通过情境完整性(Contextual Integrity, CI)的视角进行。然而,现有CI基准主要是文本导向的,主要强调消极拒绝情景,忽略了多模态隐私风险以及隐私与实用性之间的根本性权衡。本文引入MPCI-Bench,即第一个多模态成对情境完整性基准,用于评估代理环境中的隐私行为。MPCI-Bench由来自相同视觉来源的正负配对实例构成,覆盖三个层次:规范性种子判断、情境丰富的故事推理以及可执行的代理动作轨迹。通过三原则迭代精炼管道确保数据质量。对现有多模态模型的评估揭示了系统性地无法在隐私与实用性之间取得平衡,以及显著的模态泄漏差距,其中敏感视觉信息的泄漏频率高于文本信息。我们将开源MPCI-Bench以促进代理CI领域的后续研究。
引用
@article{arxiv.2601.08235,
title = {MPCI-Bench: A Benchmark for Multimodal Pairwise Contextual Integrity Evaluation of Language Model Agents},
author = {Shouju Wang and Haopeng Zhang},
journal= {arXiv preprint arXiv:2601.08235},
year = {2026}
}