MoleculeQA:评估分子理解中事实准确性的数据集
计算与语言
2024-03-14 v1 生物大分子
摘要
大语言模型在分子研究中扮演着日益重要的角色,然而现有模型常生成错误信息,给准确的分子理解带来挑战。传统的生成内容评估指标无法衡量模型在分子理解上的准确性。为弥补事实性评估的缺失,我们提出了 MoleculeQA,一个新颖的问答(QA)数据集,包含覆盖 23,000 多个分子的 62,000 个问答对。每个问答对由一个人工编写的问题、一个正确选项和三个错误选项组成,其语义与权威分子语料库中的分子描述保持一致。MoleculeQA 不仅是首个用于分子事实性偏差评估的基准,也是分子研究中规模最大的问答数据集。在 MoleculeQA 上对现有分子大语言模型的全面评估,揭示了它们在特定领域的缺陷,并指出了对分子理解尤为关键的几个因素。
引用
@article{arxiv.2403.08192,
title = {MoleculeQA: A Dataset to Evaluate Factual Accuracy in Molecular Comprehension},
author = {Xingyu Lu and He Cao and Zijing Liu and Shengyuan Bai and Leqing Chen and Yuan Yao and Hai-Tao Zheng and Yu Li},
journal= {arXiv preprint arXiv:2403.08192},
year = {2024}
}
备注
19 pages, 8 figures