中文

用户感知 vs. 代理 LLM 评判者:LLM 对隐私敏感场景响应的隐私性与有用性

计算与语言 2026-01-16 v3 人工智能 人机交互

摘要

大型语言模型 (LLM) 正迅速被用于起草电子邮件、总结会议和回答健康问题等任务。在这些场景中,用户可能需要分享私人信息(例如,联系方式、健康记录)。为了评估 LLM 识别和编辑此类信息的能力,先前的工作引入了基于真实场景的基准(例如,ConfAIde, PrivacyLens),并发现 LLM 在复杂场景中可能泄露私人信息。然而,这些评估依赖于代理 LLM 来判断 LLM 响应的有用性和隐私保护质量,而不是直接衡量用户的感知。为了理解用户如何看待 LLM 对隐私敏感场景响应的有用性和隐私保护质量,我们使用 90 个 PrivacyLens 场景进行了一项用户研究 (n=94n=94)。我们发现,用户在评估相同的 LLM 响应时,彼此之间的共识度很低。相比之下,五个代理 LLM 达成了高度共识,但每个代理 LLM 与用户的评估相关性都很低。这些结果表明,代理 LLM 无法准确估计用户在隐私敏感场景中对效用和隐私的广泛感知。我们讨论了需要进行更多以用户为中心的研究来衡量 LLM 在保护隐私的同时帮助用户的能力,以及需要改进 LLM 与用户在估计感知隐私和效用方面的一致性。

关键词

引用

@article{arxiv.2510.20721,
  title  = {User Perceptions vs. Proxy LLM Judges: Privacy and Helpfulness in LLM Responses to Privacy-Sensitive Scenarios},
  author = {Xiaoyuan Wu and Roshni Kaushik and Wenkai Li and Lujo Bauer and Koichi Onoue},
  journal= {arXiv preprint arXiv:2510.20721},
  year   = {2026}
}