中文

HumBEL:一种用于评估人机对话中语言模型人口统计学因素的人机协同方法

计算与语言 2024-02-06 v3 人工智能

摘要

尽管年龄和性别等人口统计学因素会改变人们的说话方式,尤其是人们与机器交谈的方式,但关于大型预训练语言模型(LMs)如何适应这些变化的研究甚少。为弥补这一空白,我们考量如何度量LM语言技能中的人口统计学因素,以确定其与目标人群的兼容性。我们借鉴言语语言病理学的临床技术,该学科具备人类语言技能获得的规范。我们与领域专家(即持临床执照的言语语言病理学家)开展评估,并提出自动化技术以大规模补充临床评估。实证上,我们聚焦年龄,发现LM能力随任务不同差异显著:GPT-3.5在需要推理的任务中模仿6–15岁人类的能力,同时在记忆任务上超越典型21岁人类。GPT-3.5在社会语言使用上亦有困难,表现出低于50%的被测语用技能。研究结果肯定了在将LM用作面向公众的工具时考虑人口统计学对齐与对话目标的重要性。代码、数据与软件包将公开可用。

关键词

引用

@article{arxiv.2305.14195,
  title  = {HumBEL: A Human-in-the-Loop Approach for Evaluating Demographic Factors of Language Models in Human-Machine Conversations},
  author = {Anthony Sicilia and Jennifer C. Gates and Malihe Alikhani},
  journal= {arXiv preprint arXiv:2305.14195},
  year   = {2024}
}

备注

17 pages, 9 figures, 5 tables