TurQUaz在CheckThat! 2025:通过大语言模型辩论进行科学网络话语检测
计算与语言
2025-08-13 v1 人工智能
摘要
本文介绍了我们为CheckThat! 2025的科学网络话语检测任务(任务4a)所开发的工作。我们提出了一种新颖的委员会辩论方法,该方法模拟多个大语言模型(LLM)之间的结构化学术讨论,以识别给定推文是否包含(i)科学声明、(ii)对科学研究的引用或(iii)对科学实体的提及。我们探索了三种辩论方法:i)单一辩论,由两个LLM为对立立场辩论,第三个LLM担任裁判;ii)团队辩论,多个模型在辩论的每一方内部协作;以及iii)委员会辩论,多个专家模型共同商议以达成共识,并由一个主席模型主持。我们选择委员会辩论作为主要模型,因为它在开发测试集上优于其他方法。尽管我们提出的方法在识别科学主张(10个中排名第8)或科学实体提及(10个中排名第9)方面排名不高,但在检测科学研究引用方面排名第一。
引用
@article{arxiv.2508.08265,
title = {TurQUaz at CheckThat! 2025: Debating Large Language Models for Scientific Web Discourse Detection},
author = {Tarık Saraç and Selin Mergen and Mucahid Kutlu},
journal= {arXiv preprint arXiv:2508.08265},
year = {2025}
}