中文

MolErr2Fix:基于模块化错误检测、定位、解释与修正的化学领域大语言模型可靠性基准测试

化学物理 2025-10-29 v3 人工智能

摘要

大型语言模型(LLM)在分子科学领域展现出日益增长的潜力,但常常会产生化学不准确的描述,且难以识别或论证潜在错误。这对其在科学应用中的鲁棒性和可靠性提出了重要挑战。为支持对大语言模型在化学推理方面的更严格评估,我们提出了 MolErr2Fix 基准测试体系,旨在评估大语言模型在分子描述错误检测与修正中的能力。与专注于分子到文本生成或性质预测的现有基准不同,MolErr2Fix 强调细粒度的化学理解。具体任务包括识别、定位、解释和修正分子描述中的潜在结构与语义错误。MolErr2Fix 由 1,193 条细粒度标注错误实例组成,每条实例包含四元组标注,即(错误类型、跨度位置、解释、纠正)。这些任务旨反映真实世界化学交流中所需的推理与验证类型。对当前主流大语言模型的评估显示,性能存在显著差距,凸显了需要更强化化学推理能力的迫切性。MolErr2Fix 为评估此类能力提供了聚焦基准,旨促进更可靠、更具化学导向的语言模型的发展。所有标注数据及配套评估 API 将公开发布,以促进后续研究。

关键词

引用

@article{arxiv.2509.00063,
  title  = {MolErr2Fix: Benchmarking LLM Trustworthiness in Chemistry via Modular Error Detection, Localization, Explanation, and Revision},
  author = {Yuyang Wu and Jinhui Ye and Shuhao Zhang and Lu Dai and Yonatan Bisk and Olexandr Isayev},
  journal= {arXiv preprint arXiv:2509.00063},
  year   = {2025}
}

备注

9 pages