MisSynth:利用合成数据改进 MISSCI 逻辑谬误分类
计算与语言
2025-10-31 v1 人工智能
机器学习
摘要
健康相关的误信息非常普遍且可能造成严重后果。尤其是在主张扭曲或误解科学发现时,识别此类误信息十分困难。我们研究合成数据生成和轻量级微调技术对大型语言模型(LLM)识别 MISSCI 数据集和框架中逻辑谬误论证能力的影响。在本工作中,我们提出了 MisSynth,一条应用检索增强生成(Retrieval-augmented generation, RAG)生成合成谬误样本的管道,然后用于微调 LLM 模型。我们的结果表明,微调后的模型在准确率上显著优于基线模型。例如,LLaMA 3.1 8B 微调模型在 MISSCI 测试集上相较于其原始基线实现了超过 35% 的 F1 分数提升。我们证明了即使在计算资源有限的情况下,通过引入合成谬误数据来增强有限的标注资源,仍能显著提升 LLM 在实际科学误信息任务上的零样本分类性能。该代码和合成数据集已提供于 https://github.com/mxpoliakov/MisSynth。
引用
@article{arxiv.2510.26345,
title = {MisSynth: Improving MISSCI Logical Fallacies Classification with Synthetic Data},
author = {Mykhailo Poliakov and Nadiya Shvai},
journal= {arXiv preprint arXiv:2510.26345},
year = {2025}
}