中文

适配低资源领域的小型语言模型:赫迪利旅游问答案例研究

计算与语言 2025-10-30 v1

摘要

低资源语言的领域特定问答任务面临两个关键挑战:缺乏标注数据集以及通用语言模型中对特定领域知识的有限掌握。本文提出一种多阶段微调策略,通过利用原始数据和合成数据,为赫迪利旅游领域适配轻量级语言模型。我们使用大型语言模型(LLaMA-70B、Phi-14B)生成合成问答对,以扩充有限的原始数据集。我们探索了多种训练方法并分析了其对领域泛化的影响。我们的结果表明,大型模型能够高效生成合成数据,而小型模型能够有效适应这些数据,为低资源、领域特定问答提供了可扩展的路径。

关键词

引用

@article{arxiv.2510.25273,
  title  = {Adapting Small Language Models to Low-Resource Domains: A Case Study in Hindi Tourism QA},
  author = {Sandipan Majhi and Paheli Bhattacharya},
  journal= {arXiv preprint arXiv:2510.25273},
  year   = {2025}
}

备注

Accepted at the Forum for Information Retrieval Evaluation 2025 (VATIKA Track)