中文

语言模型驱动的对话推荐中的非预期偏差

信息检索 2022-01-20 v2 人工智能 计算与语言 人机交互

摘要

对话推荐系统(CRSs)近来开始利用BERT等预训练语言模型(LM),因其能语义解释广泛的偏好表述变体。然而,预训练LM众所周知易受其训练数据中的固有偏差影响,而这些偏差可能因用于为CRSs微调LM的领域特定语言数据(如用户评论)中嵌入的偏差而加剧。我们研究了一个近期引入的CRS的LM驱动推荐主干(称为LMRec),以探究非预期偏差(即不应影响推荐的语言变体,如姓名指代或性取向、地点的间接指示)如何表现为餐厅推荐的价格与类别分布的显著偏移。我们观察到的令人警觉的结果强烈表明,LMRec已学会通过其推荐强化有害刻板印象。例如,顺带提及与黑人群体相关的姓名会显著降低推荐餐厅的价格分布,而顺带提及常见男性关联姓名则导致含酒精供应场所推荐的增加。本文呈现的这些及许多相关结果敲响警钟:LM驱动CRSs语言处理能力的进步并非没有重大挑战,即未来部署的、潜在触达数亿终端用户的CRS助手需缓解非预期偏差。

关键词

引用

@article{arxiv.2201.06224,
  title  = {Unintended Bias in Language Model-driven Conversational Recommendation},
  author = {Tianshu Shen and Jiaru Li and Mohamed Reda Bouadjenek and Zheda Mai and Scott Sanner},
  journal= {arXiv preprint arXiv:2201.06224},
  year   = {2022}
}

备注

12 pages, 7 figures