语言生成模型可致害:我们如何应对?一份可操作综述
计算与语言
2023-02-23 v2
摘要
大型语言模型生成类人文本能力的近期进展,导致其在面向用户的场景中被更多采用。与此同时,这些改进引发了关于其带来的社会危害风险(无论无意还是恶意)的热烈讨论。若干研究已探讨这些危害,并呼吁通过开发更安全、更公平的模型来缓解。超越 merely 列举危害风险,本工作提供一份关于应对语言生成模型潜在威胁与社会危害的实用方法综述。我们借鉴若干先前工作对语言模型风险的分类型框架,呈现用于检测与改善语言生成器不同种类风险/危害策略的结构化概览。通过桥接多样研究脉络,本综述旨在作为 LM 研究者与实践者的实用指南,阐释不同缓解策略的动机、局限及未来研究的开放问题。
引用
@article{arxiv.2210.07700,
title = {Language Generation Models Can Cause Harm: So What Can We Do About It? An Actionable Survey},
author = {Sachin Kumar and Vidhisha Balachandran and Lucille Njoo and Antonios Anastasopoulos and Yulia Tsvetkov},
journal= {arXiv preprint arXiv:2210.07700},
year = {2023}
}
备注
EACL 2023 (24 pages, 1 figure, 1 table)