中文

DAIQ:基于问题的大型语言模型人口属性推断审计框架

计算与语言 2026-01-27 v2 人工智能

摘要

近期对大型语言模型(LLMs)的评估主要通过引用明确人口属性的提示来审计社会偏见,忽略了模型是否从中性问题中推断出敏感人口属性的能力。这种推断构成知识性过度延伸,引发隐私方面的担忧。我们提出 Demographic Attribute Inference from Questions(DAIQ),这是一种用于评估在认知不确定性下的人口属性推断的诊断性审计框架。我们评估了 18 个开放和闭源大型语言模型,涵盖六个真实世界领域和五个人口属性。我们发现,许多模型确实从中性问题中推断出人口属性, defaulting 到社会主导类别,并生成与偏见关联的合理论。这种行为在模型家族、规模和解码设置之间均持续存在,表明模型依赖于所学的人群先验。我们进一步表明,推断出的人口属性可用于条件化下游响应,而否决性提示显著无需模型微调即可大幅减少意外推断。我们的结果表明,当前的偏见评估不完整,动机在于评估标准不仅要考察模型如何响应人口信息,还要考察模型是否应该对其进行推断。

关键词

引用

@article{arxiv.2508.15830,
  title  = {DAIQ: Auditing Demographic Attribute Inference from Question in LLMs},
  author = {Srikant Panda and Hitesh Laxmichand Patel and Shahad Al-Khalifa and Amit Agarwal and Hend Al-Khalifa and Sharefah Al-Ghamdi},
  journal= {arXiv preprint arXiv:2508.15830},
  year   = {2026}
}

备注

Preprint