中文

FactFinders在CheckThat! 2024:通过数据剪枝利用大语言模型精炼值得核查的陈述检测

计算与语言 2024-06-27 v1

摘要

通过社交媒体和互联网快速传播信息给事实核查带来了重大挑战,其中之一是识别值得核查的声明,即事实核查员应关注的声明,也就是从大量句子中筛选出需要事实核查的声明。这一挑战凸显了需要专注于确定声明的优先级,特别是哪些声明值得进行事实核查。尽管近年来该领域取得了进展,但大语言模型(LLM)的应用,如GPT,直到最近才引起研究的关注。然而,许多开源大语言模型仍未得到充分探索。因此,本研究调查了八种突出的开源大语言模型,结合微调和提示工程,用于从政治转录文本中识别值得核查的陈述。此外,我们提出了一种两步数据剪枝方法,以自动识别高质量的训练数据实例,从而实现有效学习。我们方法的效率通过在CheckThat! 2024的值得核查性估计任务中对英语数据集的评估得到证明。此外,使用数据剪枝进行的实验表明,仅使用约44%的训练数据即可达到有竞争力的性能。我们的团队在英语语言的值得核查性估计任务中排名第一。

关键词

引用

@article{arxiv.2406.18297,
  title  = {FactFinders at CheckThat! 2024: Refining Check-worthy Statement Detection with LLMs through Data Pruning},
  author = {Yufeng Li and Rrubaa Panchendrarajan and Arkaitz Zubiaga},
  journal= {arXiv preprint arXiv:2406.18297},
  year   = {2024}
}