中文

有害文本的特征:迈向语言模型的严格基准测试

计算与语言 2022-10-31 v2 人工智能 计算机与社会

摘要

大语言模型生成类人文本,驱动着日益增长的应用。然而,近期文献以及日益增多的现实观察表明,这些模型可能生成有毒、有偏见、不真实或其他有害的语言。尽管评估语言模型危害的工作正在进行,但将关于哪些危害可能浮现的前瞻转化为严格基准并非易事。为促进这一转化,我们勾勒出在 designing 新基准时值得显式考量的刻画有害文本的六种方式。随后我们以这些特征为透镜,识别现有基准中的趋势与缺口。最后,我们将它们应用于 Perspective API 的案例研究,该毒性分类器被广泛用于危害基准。我们的特征提供了连接前瞻与有效评估之桥的一块拼图。

关键词

引用

@article{arxiv.2206.08325,
  title  = {Characteristics of Harmful Text: Towards Rigorous Benchmarking of Language Models},
  author = {Maribeth Rauh and John Mellor and Jonathan Uesato and Po-Sen Huang and Johannes Welbl and Laura Weidinger and Sumanth Dathathri and Amelia Glaese and Geoffrey Irving and Iason Gabriel and William Isaac and Lisa Anne Hendricks},
  journal= {arXiv preprint arXiv:2206.08325},
  year   = {2022}
}

备注

Accepted to NeurIPS 2022 Datasets and Benchmarks Track; 10 pages plus appendix