中文

示范即所需:利用上下文学习推进攻击性内容改写

计算与语言 2024-06-11 v2 人工智能

摘要

攻击性内容的改写是内容删除的更好替代方案,有助于改善交流环境中的文明程度。然而,有监督的改写器严重依赖大量标注数据以帮助保留含义与意图。它们还经常保留原内容的大部分攻击性,这对其整体可用性提出了质疑。在本文中,我们旨在通过探索使用大语言模型(LLM)的上下文学习(ICL)来协助从业者开发可用的改写器,即使用有限数量的输入-标签示范对来引导模型为特定查询生成所需输出。我们的研究聚焦于关键因素,如示范的数量与顺序、提示指令的省略,以及测得毒性的降低。我们在三个数据集上进行了严谨评估,包括我们提出的 Context-Aware Polite Paraphrase(CAPP)数据集,其包含对话式粗鲁话语、礼貌改写以及额外对话上下文。我们使用四个闭源和一个开源 LLM 评估了我们的方法。结果表明,ICL 在生成质量上与有监督方法相当,而在人工评估上定性优 25%,毒性降低 76%。此外,即便仅使用 10% 的训练数据,基于 ICL 的改写器性能也仅出现轻微下降。

关键词

引用

@article{arxiv.2310.10707,
  title  = {Demonstrations Are All You Need: Advancing Offensive Content Paraphrasing using In-Context Learning},
  author = {Anirudh Som and Karan Sikka and Helen Gent and Ajay Divakaran and Andreas Kathol and Dimitra Vergyri},
  journal= {arXiv preprint arXiv:2310.10707},
  year   = {2024}
}

备注

Accepted in Association for Computational Linguistics (ACL) 2024 Findings