中文

文化指南针:用于检测人类-人工智能对话中违规行为的规范组织框架

计算机与社会 2026-01-14 v1 人工智能 计算与语言

摘要

生成式人工智能模型应在跨文化语境中具有实用性和安全性。实现这一目标的一个关键步骤是理解AI模型如何遵守社会文化规范。虽然这一挑战在NLP领域引起了关注,但现有工作在理解和评估模型遵守规范的细微差别和覆盖范围方面不足。我们通过引入规范分类法来弥补这些差距,该分类法阐明了规范的上下文(例如区分模型应识别的人类-人类规范以及适用于人类-人工智能交互的规范),规范(例如相关领域),以及执行机制(例如执行方式)。我们展示了如何将该分类法操作化,以在自然且开放的环境中自动评估模型的规范遵守情况。我们的探索性分析表明,最先进的模型经常违反规范,但违规率因模型、交互环境和国家而异。我们进一步表明,违规率也因提示意图和情境安排而异。我们的分类法和示范性评估管道使我们能够在真实情境中进行细粒度、情境敏感的文化规范遵守评估。

关键词

引用

@article{arxiv.2601.07973,
  title  = {Cultural Compass: A Framework for Organizing Societal Norms to Detect Violations in Human-AI Conversations},
  author = {Myra Cheng and Vinodkumar Prabhakaran and Alice Oh and Hayk Stepanyan and Aishwarya Verma and Charu Kalia and Erin MacMurray van Liemt and Sunipa Dev},
  journal= {arXiv preprint arXiv:2601.07973},
  year   = {2026}
}