面向领域特定 RAG 系统的 AI 评估:AgriHubi 案例研究
计算与语言
2026-02-03 v1 人工智能
信息检索
软件工程
摘要
大型语言模型在知识密集型领域展现出广阔前景,但在农业领域的应用受限于 grounding 能力弱、训练数据以英语为中心且缺乏真实世界评估。这些问题在低资源语言环境中尤为突出——此时高质量的领域文档虽存在,却难以通过通用模型轻松获取。本文提出 AgriHubi,一个针对芬兰语农业决策支持构建的领域适配检索增强生成 (RAG) 系统。AgriHubi 将芬兰语农业文档与开放的 PORO 系列模型相结合,融合显式来源 grounding 与用户反馈,支持迭代式细化。该系统经过八次迭代开发,并通过两项用户研究进行评估,显示出在答案完整性、语言准确性和感知可靠性方面均取得显著提升。结果还揭示了在部署大型模型时,响应质量与延迟之间的实际权衡。本研究为在低资源语言环境中设计和评估领域特定 RAG 系统提供了实证指导。
引用
@article{arxiv.2602.02208,
title = {Towards AI Evaluation in Domain-Specific RAG Systems: The AgriHubi Case Study},
author = {Md. Toufique Hasan and Ayman Asad Khan and Mika Saari and Vaishnavi Bankhele and Pekka Abrahamsson},
journal= {arXiv preprint arXiv:2602.02208},
year = {2026}
}
备注
6 pages, 2 figures, submitted to MIPRO 2026