利用大型语言模型联合检测立场与辟谣的强化调优
计算与语言
2024-06-05 v1
摘要
学习用于联合检测立场和验证谣言的多任务模型面临挑战,因为需要帖子级别的立场训练数据和声明级别的谣言真实性训练数据,而这些数据难以获取。为了解决这个问题,我们利用大型语言模型作为联合立场检测和谣言验证任务的基础标注器,称为 JSDRV。我们引入了一种新颖的强化调优框架,以增强基于 LLM 的 SD 和 RV 组件的联合预测能力。具体来说,我们设计了一种策略,用于在两个级别上选择 LLM 标注的数据,采用混合奖励机制来选择高质量标签,以便在两个任务上对 LLM 进行有效的微调。结果表明,JSDRV 提升了 LLM 在联合任务中的能力,不仅优于最先进的方法,而且能够泛化到作为任务模型的非 LLM。
引用
@article{arxiv.2406.02143,
title = {Reinforcement Tuning for Detecting Stances and Debunking Rumors Jointly with Large Language Models},
author = {Ruichao Yang and Wei Gao and Jing Ma and Hongzhan Lin and Bo Wang},
journal= {arXiv preprint arXiv:2406.02143},
year = {2024}
}
备注
ACL 2024 (Findings)