ChEmbed:通过领域特定文本嵌入提升化学文献检索
信息检索
2025-08-05 v1 计算与语言
摘要
化学领域的检索增强生成 (RAG) 系统高度依赖准确且相关的文献检索。然而,通用文本嵌入模型常常未能充分表征复杂的化学术语,导致检索质量次优。尚未开发出针对化学文献检索的专业嵌入模型,这在一定程度上留下了显著的性能差距。为解决这一挑战,我们引入 ChEmbed,一套在由 PubChem、Semantic Scholar 和 ChemRxiv 语料库构成的数据集上微调的领域适应文本嵌入模型。为创建有效的训练数据,我们利用大型语言模型合成生成查询,产生约 170 万个高质量查询-段落对。此外,我们通过在先前未使用的槽位中添加 900 个化学专用 token 来增强词汇表,这显著减少了化学实体(如 IUPAC 名称)的碎片化。ChEmbed 还保持 8192 token 的上下文长度,使其能够高效检索较长的段落,而许多其他开源嵌入模型通常的上下文长度为 512 或 2048 token。在我们新引入的 ChemRxiv 检索基准测试中,ChEmbed 在各种通用嵌入模型上实现了显著优势,将 nDCG@10 从 0.82 提升至 0.91 (提升 9 个百分点)。ChEmbed 代表了一个实用、轻量且可复现的嵌入解决方案,有效提升了化学文献检索的检索质量。
引用
@article{arxiv.2508.01643,
title = {ChEmbed: Enhancing Chemical Literature Search Through Domain-Specific Text Embeddings},
author = {Ali Shiraee Kasmaee and Mohammad Khodadad and Mehdi Astaraki and Mohammad Arshi Saloot and Nicholas Sherck and Hamidreza Mahyar and Soheila Samiee},
journal= {arXiv preprint arXiv:2508.01643},
year = {2025}
}