利用合成数据在农业领域驱动多语言 LLM 问答
计算与语言
2025-08-04 v2 人工智能
摘要
使农民能够及时以其母语获取准确的农业相关信息,对于农业领域的成功至关重要。公开可用的通用大型语言模型通常提供通用的农业咨询,在本地和多语言语境中缺乏精确性。我们的研究通过从印度农业特定文档生成多语言(英语、印地语、旁遮普语)合成数据集,并针对问答 (QA) 任务微调 LLM 来解决这一局限性。在人工创建的数据集上的评估表明,与基线模型相比,微调后的 LLM 在事实性、相关性和农业共识方面均有显著提升。
引用
@article{arxiv.2507.16974,
title = {Leveraging Synthetic Data for Question Answering with Multilingual LLMs in the Agricultural Domain},
author = {Rishemjit Kaur and Arshdeep Singh Bhankhar and Jashanpreet Singh Salh and Sudhir Rajput and Vidhi and Kashish Mahendra and Bhavika Berwal and Ritesh Kumar and Surangika Ranathunga},
journal= {arXiv preprint arXiv:2507.16974},
year = {2025}
}
备注
16 pages, 9 tables, Appendix A-L