STRICTA:同行评审及更广泛场景中关键文本评估的结构化推理
计算与语言
2025-06-03 v2
摘要
关键文本评估是许多专家活动的核心,例如事实核查、同行评审和论文评分。然而,现有工作将关键文本评估视为黑盒问题,限制了可解释性与人机协作。为弥补这一差距,我们引入了关键文本评估中的结构化推理 (Structured Reasoning In Critical Text Assessment, STRICTA),这是一种将文本评估建模为显式分步推理过程的新型规范框架。STRICTA 借助因果理论 (Pearl, 1995),将评估分解为相互关联的推理步骤图。该图基于专家交互数据填充,用于研究评估过程并促进人机协作。我们正式定义了 STRICTA,并将其应用于一项生物医学论文评估研究中,由此生成了一个包含约 40 位生物医学专家对 20 余篇论文的超过 4000 个推理步骤的数据集。我们使用该数据集实证研究了关键文本评估中的专家推理,并调查了 LLM 是否能够在这些工作流程中模仿和支持专家。由此产生的工具和数据集为研究同行评审及更广泛场景中文本评估的专家-AI 协作推理铺平了道路。
引用
@article{arxiv.2409.05367,
title = {STRICTA: Structured Reasoning in Critical Text Assessment for Peer Review and Beyond},
author = {Nils Dycke and Matej Zečević and Ilia Kuznetsov and Beatrix Suess and Kristian Kersting and Iryna Gurevych},
journal= {arXiv preprint arXiv:2409.05367},
year = {2025}
}
备注
Accepted at ACL 2025