iTRI-QA:面向科学研究的基于语言模型的定制问答数据集生成工具集
信息检索
2025-02-25 v1 人工智能
数字图书馆
摘要
AI 在科学领域的指数级增长 necessitates 高效且可扩展的解决方案来检索和保存研究信息。本文提出了一个用于开发定制问答(QA)数据集的工具,称为交互式训练研究创新者(Interactive Trained Research Innovator, iTRI)-QA,旨在满足依赖语言模型(LMs)检索科学知识的研究人员的需求。我们的 метод将精选的 QA 数据集与专门的研究论文数据集相集成,通过微调语言模型来增强响应的上下文相关性和准确性。该框架包括四个关键步骤:(1)生成高质量和人工生成的 QA 示例,(2)创建结构化的研究论文数据库,(3)使用领域特定的 QA 示例微调语言模型,(4)生成与用户查询和精选数据库相匹配的 QA 数据集。该管道提供了一个动态且领域特定的 QA 系统,旨在增强语言模型在学术研究中的实用性,将用于未来的研究语言模型部署。我们展示了该工具在简化科学语境下的知识检索中的可行性和可扩展性,为其集成到更广泛的跨学科应用奠定了基础。
引用
@article{arxiv.2502.15721,
title = {iTRI-QA: a Toolset for Customized Question-Answer Dataset Generation Using Language Models for Enhanced Scientific Research},
author = {Qiming Liu and Zhongzheng Niu and Siting Liu and Mao Tian},
journal= {arXiv preprint arXiv:2502.15721},
year = {2025}
}
备注
13 pages, 3 figures