NDAI-NeuroMAP:面向神经科学领域的嵌入模型用于领域特定检索
人工智能
2025-07-08 v1
摘要
我们提出NDAI-NeuroMAP,这是首个为神经科学领域量身定制的稠密向量嵌入模型,专为高精度信息检索任务而设计。我们的 methodologies 包括构建由50万个精心构造的三元组(查询-正例-负例配置)组成的大型领域特定训练语料库,外加25万个神经科学特定定义条目和25万个来自权威神经学本体法学派生的结构化知识图谱三元组。我们采用精妙的微调方法,利用FremyCompany/BioLORD-2023基础模型,实施一种结合对比学习与三元组基于度量学习范式的多目标优化框架。对约24,000个神经科学特定查询组成的 held-out 测试数据集进行全面评估,结果显示相较于最先进的通用型和生物医学嵌入模型,NDAI-NeuroMAP在性能上实现了显著提升。这些实证发现凸显了针对神经科学领域的RAG系统和相关临床自然语言处理应用的领域特定嵌入架构的重要性。
引用
@article{arxiv.2507.03329,
title = {NDAI-NeuroMAP: A Neuroscience-Specific Embedding Model for Domain-Specific Retrieval},
author = {Devendra Patel and Aaditya Jain and Jayant Verma and Divyansh Rajput and Sunil Mahala and Ketki Suresh Khapare and Jayateja Kalla},
journal= {arXiv preprint arXiv:2507.03329},
year = {2025}
}
备注
The document consists of 15 pages in total: the first 13 pages comprise the main paper, while the last two pages contain supplementary material