论文重建评估:评估AI撰写论文中的呈现与幻觉
密码学与安全
2026-04-02 v1
摘要
本文提出了首个系统性评估框架,用于量化现代编码代理撰写的论文质量和风险。虽然AI驱动的论文撰写已成为日益关注的问题,但对AI撰写论文质量和潜在风险的严格评估仍然有限,对其可靠性的统一理解仍然缺乏。我们引入了论文重建评估(PaperRecon),这是一个评估框架,其中从现有论文创建概述(overview.md),然后代理基于该概述和最少额外资源生成完整论文,随后将结果与原始论文进行比较。PaperRecon将AI撰写论文的评估分解为两个正交维度:呈现和幻觉,其中呈现使用评分标准进行评估,幻觉通过基于原始论文来源的智能体评估来衡量。对于评估,我们引入了PaperWrite-Bench,一个涵盖2025年后发表的跨多个领域的51篇顶级会议论文的基准。我们的实验揭示了一个明显的权衡:虽然ClaudeCode和Codex都随着模型进步而提升,但ClaudeCode以平均每篇论文超过10次幻觉为代价实现了更高的呈现质量,而Codex产生的幻觉更少但呈现质量较低。这项工作迈出了建立AI驱动论文撰写评估框架的第一步,并加深了研究界对其风险的理解。
引用
@article{arxiv.2604.01127,
title = {Multi-Agent LLM Governance for Safe Two-Timescale Reinforcement Learning in SDN-IoT Defense},
author = {Saeid Jamshidi and Negar Shahabi and Foutse Khomh and Carol Fung and Mohammad Hamdaqa},
journal= {arXiv preprint arXiv:2604.01127},
year = {2026}
}