评估微调大语言模型进行政治论证风险:仇恨言论与僵化性
计算与语言
2025-11-04 v4 人工智能
摘要
Twitter(现为X)和Reddit等平台上的仇恨言论 complicate the development of能够 support productive, rhetorically sound political argumentation 的 AI系统。我们对 GPT-3.5 Turbo进行 fine-tuning,使用来自两个对比数据集的政治话语进行训练:来自美国国会的 high-incivility Twitter 回复 和 来自 Reddit r/ChangeMyView 的 low-incivility帖子。我们的评估 examines data composition and prompting strategies 对 model-generated arguments 的修辞框架和 deliberative quality 的影响。结果显示,Reddit fine-tuning 的模型生成更 safe 但修辞上僵化,而跨平台 fine-tuning 则放大了对抗性语气和 toxicity。基于提示的引导可减少明显的 toxicity(如人身攻击),但无法完全抵消噪声训练数据的影响。我们引入了一个覆盖 justification、reciprocity、alignment 和 authority 的修辫 evaluation rubric,并提供 authoring、moderation 和 deliberation-support systems 的 implementation guidelines。
引用
@article{arxiv.2411.16813,
title = {Incivility and Rigidity: Evaluating the Risks of Fine-Tuning LLMs for Political Argumentation},
author = {Svetlana Churina and Kokil Jaidka},
journal= {arXiv preprint arXiv:2411.16813},
year = {2025}
}