双重分块、单次嵌入:化学感知检索增强生成中的分段与表示权衡的系统性研究
信息检索
2025-06-24 v1 人工智能
化学物理
摘要
检索增强生成 (Retrieval-Augmented Generation, RAG) 系统日益重要于导航不断扩张的科学文献,尤其是在化学等高风险领域。尽管 RAG 前景可望,但基础性设计选择——如文档如何分块及其表示方式——在领域特定情境下仍鲜有探讨。本研究首次对针对化学专注型 RAG 系统的分块策略与嵌入模型进行大规模、系统化评估。我们检验 25 种分块配置,涵盖 5 大方法家族,并在 3 个化学专用基准测试(包括新引入的 QuestChemRetrieval 数据集)上评估 48 个嵌入模型。结果显示,递归标记分块(具体为 R100-0)始终优于其他方法,既性能卓越又资源开销最小。我们还发现,检索优化型嵌入(如 Nomic 与 Intfloat E5 变体)显著优于领域专用模型如 SciBERT。通过公开数据集、评估框架与实证基准,本文为构建高效、高性价比的化学感知 RAG 系统提供可操作指南。
引用
@article{arxiv.2506.17277,
title = {Chunk Twice, Embed Once: A Systematic Study of Segmentation and Representation Trade-offs in Chemistry-Aware Retrieval-Augmented Generation},
author = {Mahmoud Amiri and Thomas Bocklitz},
journal= {arXiv preprint arXiv:2506.17277},
year = {2025}
}