东北大学参与多语言反仇恨言论生成:通过直接偏好优化增强反言论生成的 LLM 对齐
计算与语言
2024-12-23 v1 人工智能
摘要
自动生成反言论 (CS) 是应对仇恨言论的关键策略,它通过提供建设性和有根据的回复来实现。然而,现有方法往往无法生成高质量、有影响力且可扩展的 CS,特别是在多样化的语言环境中。在本文中,我们提出了一种新方法,通过使用监督微调 (SFT) 和直接偏好优化 (DPO) 对齐大型语言模型 (LLMs) 来增强 CS 生成。我们的方法利用 DPO 将 LLM 输出与人类偏好对齐,确保上下文适当且语言适应性强的回复。此外,我们结合了知识基础以增强生成 CS 的事实准确性和相关性。实验结果表明,DPO 对齐的模型在 CS 基准测试上显著优于 SFT 基线,同时可有效扩展至多种语言。这些发现突显了基于偏好的对齐技术在跨越不同语言环境推进 CS 生成方面的潜力。模型监督和对齐在英语中进行,并且同一模型用于报告跨其他语言(如巴斯克语、意大利语和西班牙语)的指标。
引用
@article{arxiv.2412.15453,
title = {Northeastern Uni at Multilingual Counterspeech Generation: Enhancing Counter Speech Generation with LLM Alignment through Direct Preference Optimization},
author = {Sahil Wadhwa and Chengtian Xu and Haoming Chen and Aakash Mahalingam and Akankshya Kar and Divya Chaudhary},
journal= {arXiv preprint arXiv:2412.15453},
year = {2024}
}
备注
10 pages, 6 tables, 1 figure, The First Workshop on Multilingual Counterspeech Generation (MCG) at The 31st International Conference on Computational Linguistics (COLING 2025)