中文

通过设计披露:对话式AI模型的身份透明度作为行为属性

人机交互 2026-03-19 v1 人工智能

摘要

随着对话式AI系统变得越来越逼真且广泛部署,用户越来越难确定自己是否正在与人类或AI系统交互。当AI身份不清晰时,用户可能无意中泄露敏感信息,对AI生成的建议缺乏合理的信任,或受制于AI-enabled欺诈。更广泛地说,持续的透明度不足会削弱对中介沟通的信任。虽然欧盟AI法案和加州BOT法案等法规要求AI系统自我识别,但仅提供有限的实时对话披露指导。现有的透明度机制也存在空白:界面指示器可能被部署方省略,源venance工具需要协调的基础设施且无法提供可靠的实时验证。我们思考在人类与AI交互变得越来越模糊和多样化时,对话式AI系统应如何维持身份透明度。我们主张通过设计披露,即在被直接询问时,AI系统显式披露其人工身份。作为模型行为实现,披露可以在部署语境中持续存在,而无需依赖用户界面,同时保留用户按需验证身份的自主权,而不会干扰角色扮演等沉浸式用例。为评估当前实践,我们呈现首个多模态(文本和语音)对话式AI系统披露行为在基线、角色扮演和对抗性情境下的评估。我们发现基线披露率通常较高,但在角色扮演情境下会显著下降,且在对抗性提示下可能被压制。重要的是,披露率在不同提供商和模态之间存在显著差异,这凸显了当前披露行为的脆弱性。我们随后提出技术干预措施,以帮助开发人员将披露作为对话式AI模型的基本属性进行嵌入。

关键词

引用

@article{arxiv.2603.16874,
  title  = {Disclosure By Design: Identity Transparency as a Behavioural Property of Conversational AI Models},
  author = {Anna Gausen and Sarenne Wallbridge and Hannah Rose Kirk and Jennifer Williams and Christopher Summerfield},
  journal= {arXiv preprint arXiv:2603.16874},
  year   = {2026}
}

备注

25 pages, 5 figures