信任机器:在人类-LLM对话中发现个人披露
计算与语言
2024-07-23 v2
摘要
测量人类与聊天机器人交互中所作的个人披露,可帮助我们更好地理解用户的AI素养,并为大型语言模型(LLMs)的隐私研究提供支持。我们对商业GPT模型中真实用户所作的个人披露进行了广泛且细粒度的分析,调查个人可识别信息(PII)和敏感信息的泄露。为理解用户在何种情境下向聊天机器人披露信息,我们基于对自然发生对话的定性和定量分析,发展了一套任务和敏感话题的分类框架。我们讨论了这些潜在的隐私危害,并观察到:(1)个人可识别信息(PII)出现在意外的情境中,例如在翻译或代码编辑中(分别占48%和16%),且(2)仅靠PII检测不足以捕捉人类-聊天机器人交互中常见的敏感话题,例如详细的性偏好或特定的毒品使用习惯。我们认为,这些高披露率对研究人员和数据策划者具有重要意义,我们呼吁设计适当的引导机制以帮助用户管理他们的交互。
引用
@article{arxiv.2407.11438,
title = {Trust No Bot: Discovering Personal Disclosures in Human-LLM Conversations in the Wild},
author = {Niloofar Mireshghallah and Maria Antoniak and Yash More and Yejin Choi and Golnoosh Farnadi},
journal= {arXiv preprint arXiv:2407.11438},
year = {2024}
}