中文

AI 中的青少年表征偏见:双语、双文化研究

计算机与社会 2024-08-06 v1 人工智能 计算与语言 人机交互 机器学习

摘要

主流和新闻媒体常将青少年描绘为社会风险本身以及可能面临风险的对象。随着 AI 开始承担传统媒体的部分认知功能,我们研究青少年在两种语言中被 AI 如何被表征以及他们希望被如何表征。具体而言,我们研究由静态词嵌入(SWEs)和生成式语言模型(GLMs)学习到的关于青少年的偏见,并将其与来自美国和尼泊尔的青少年观点进行比较。我们发现英文 SWEs 将青少年与社会问题关联,其中超过 50% 的与青少年最相关的 1000 个词反映了此类问题。针对关于青少年的提示,GPT2-XL 和 LLaMA-2-7B 的 30% 和 29% 的输出讨论了社会问题,最常见的是暴力,但也包括毒品使用、精神疾病和性禁忌。虽然尼泊尔模型也存在此类关联,但未被社会问题主导。来自 N=13 名美国青少年和 N=18 名尼泊尔青少年的工作坊数据表明,AI 的表述与青少年生活脱节,后者围绕着校园和友谊等活动。青少年对 20 个特征词如何描述青少年的评级与 SWEs 关联性分离,其中 FastText 中的英文和 GloVe 中的英文均为 r=.02 且不显著,尼泊尔 FastText 和 GloVe 中的尼泊尔模型分别为 r=.06 和 r=-.23 且不显著。美国参与者建议,AI 可通过突出多样性来公正地表现青少年,而尼泊尔参与者则强调积极性。青少年对如果从青少年身上学习而非媒体来源,AI 能否缓解刻板印象持乐观态度。我们的工作提供了了解 SWEs 和 GLMs 如何误表述一个发展中易受攻击群体的方式,并为更少感性化的表征提供了模板。

关键词

引用

@article{arxiv.2408.01961,
  title  = {Representation Bias of Adolescents in AI: A Bilingual, Bicultural Study},
  author = {Robert Wolfe and Aayushi Dangol and Bill Howe and Alexis Hiniker},
  journal= {arXiv preprint arXiv:2408.01961},
  year   = {2024}
}

备注

Accepted at Artificial Intelligence, Ethics, and Society 2024