微调语言模型与大型语言模型在多语言多主题事实核查值得检测任务上的基准评测
计算与语言
2024-10-14 v2
摘要
本研究比较了(1)微调语言模型与(2)大型语言模型在事实核查值得检测(check-worthy claim detection)任务上的性能。为进行比较,我们构建了一个包含多来源多风格文本的多语言多主题数据集。在此基础上,我们进行了基准分析以确定最具通用性的多语言多主题声明检测器。我们选取了事实核查值得检测任务中三个最先进的模型并对其进行微调。此外,我们选择了四个未经任何微调的最先进大型语言模型。我们对模型进行修改以适配多语言环境,并通过大量实验与评估,在域内与跨域场景下依据准确率、召回率与 F1 分数评估了所有模型的性能。我们的结果表明,尽管自然语言处理领域取得了技术进展,为事实核查值得检测任务微调的模型在跨域设置中仍优于零样本方法。
引用
@article{arxiv.2311.06121,
title = {Multilingual and Multi-topical Benchmark of Fine-tuned Language models and Large Language Models for Check-Worthy Claim Detection},
author = {Martin Hyben and Sebastian Kula and Ivan Srba and Robert Moro and Jakub Simko},
journal= {arXiv preprint arXiv:2311.06121},
year = {2024}
}
备注
21 pages, 10 figures, 18 tables