基于意图条件和非有害性的多任务指令调优RLAIF反向言语生成
计算与语言
2024-03-18 v1 人工智能
摘要
反向言语(Counterspeech)被定义为针对缓解线上仇恨言论的回应,正因其非审查性质而日益受到关注。有效应对仇恨言论涉及消解其中常以简短单句或侮辱性表述中潜藏的刻板印象、偏见和偏见。这些隐含表达对语言模型构成挑战,尤其是在序列到序列任务中,因为模型性能通常在较长上下文中表现更佳。本研究引入CoARL框架,通过建模社交偏见在仇恨表述背后的实用主义含义来增强反向言语生成。CoARL的前两个阶段涉及顺序的多指令调优,教会模型理解冒犯表述的意图、反应和伤害,并学习任务特定的低秩适配器权重以生成意图条件化的反向言语。最终阶段使用强化学习微调输出以提高效果和非有害性。CoARL在意图条件化反向言语生成方面超越了现有基准,在意图一致性和论证质量指标上平均提升3分和4分。大量人类评估支持CoARL在生成更优质且更恰当的响应方面的有效性,包括ChatGPT等主流大模型。
引用
@article{arxiv.2403.10088,
title = {Intent-conditioned and Non-toxic Counterspeech Generation using Multi-Task Instruction Tuning with RLAIF},
author = {Amey Hengle and Aswini Kumar and Sahajpreet Singh and Anil Bandhakavi and Md Shad Akhtar and Tanmoy Chakroborty},
journal= {arXiv preprint arXiv:2403.10088},
year = {2024}
}