基于域适应基础模型的印度语言旅游问答系统
计算与语言
2025-12-01 v1 人工智能
摘要
本文提出首个针对印度语言旅游领域设计的基准提取式问答(QA)系统,特别关注Varanasi——一种以Bhakti-Bhaav(虔诚精神)闻名的文化与精神中心。针对十个旅游子领域(Ganga Aarti、Cruise、Food Court、Public Toilet、Kund、Museum、General、Ashram、Temple和Travel),本文解决针对印度语QA资源在文化细化应用中缺失的难题。本文构建了包含7,715对印度语QA对的数据集,并通过Llama零shot提示扩展为27,455对。我们提出一种框架,利用基础模型(BERT和RoBERTa),通过监督微调(SFT)和低秩适应(LoRA)进行微调,以优化参数效率和任务性能。评估了多个BERT变体(包括预训练语言模型,如Hindi-BERT)的适用性,以评估其在低资源领域特定QA中的适合性。评估指标(F1、BLEU和ROUGE-L)突显了答案精确度与语言流畅性之间的权衡。实验表明,LoRA-based微调在保持竞争性能(85.3% F1)的同时,将可训练参数减少98%,在效率与准确性之间取得了平衡。跨模型的比较分析显示,RoBERTa配合SFT在捕捉文化嵌入术语(如Aarti、Kund)的语境方面优于BERT变体。这一工作为印度语言旅游QA系统奠定了基础基准,强调了在低资源环境中LORA的作用,以及旅游领域文化语境化NLP框架的必要性。
引用
@article{arxiv.2511.23235,
title = {Tourism Question Answer System in Indian Language using Domain-Adapted Foundation Models},
author = {Praveen Gatla and Anushka and Nikita Kanwar and Gouri Sahoo and Rajesh Kumar Mundotiya},
journal= {arXiv preprint arXiv:2511.23235},
year = {2025}
}