中文

让模型回应:从提示依赖视角解读语言模型解毒

计算与语言 2023-09-06 v1

摘要

由于语言模型倾向于生成有毒或仇恨回应,已开发若干技术使模型生成与用户偏好对齐。尽管此类方法在提升模型交互安全性方面有效,其对模型内部过程的影响仍知之甚少。本工作中,我们将流行的解毒方法应用于若干语言模型,并利用特征归因方法量化所得模型的提示依赖所受影响。我们评估反叙事微调的有效性,并将其与强化学习驱动的解毒进行比较,观察到尽管两者解毒性能相似,但方法间的提示依赖存在差异。

关键词

引用

@article{arxiv.2309.00751,
  title  = {Let the Models Respond: Interpreting Language Model Detoxification Through the Lens of Prompt Dependence},
  author = {Daniel Scalena and Gabriele Sarti and Malvina Nissim and Elisabetta Fersini},
  journal= {arXiv preprint arXiv:2309.00751},
  year   = {2023}
}

备注

4 pages