理解 QA 生成:从 CQA 中提取低资源孟加拉语语言中的参数化与情境知识
计算与语言
2026-02-03 v1
摘要
低资源语言如孟加拉语的问答 (QA) 模型面临数据标注有限和语言复杂性等挑战。关键问题在于确定模型在答案生成过程中更依赖于预编码的参数化知识还是上下文输入,因为现有的孟加拉语 QA 数据集缺乏此类分析所需的结构。我们引入 BanglaCQA,即孟加拉语首个逆向 QA 数据集,通过扩展现有孟加拉语数据集并集成逆向段落和可判性标注,实现了该数据集。此外,我们提出了针对编码-解码语言特定模型和多语言基线模型的微调管道,以及针对解码-only LLM 的提示工程管道,以在事实和逆向情境场景中解离参数化知识与情境知识。进一步,我们应用 LLM 基于和人类评估技术,对答案质量基于语义相似性进行衡量。我们还对模型在低资源语言中不同 QA 设置下的表现进行了详细分析,表明链式思维 (CoT) 提示在解码-only LLM 中尤其有效,能在逆向情境场景中提取参数化知识。我们的工作不仅引入了分析孟加拉语 QA 中知识来源的新框架,还发现了开辟低资源语言设置下逆向推理更广泛方向的关键发现。
引用
@article{arxiv.2602.01451,
title = {Understanding QA generation: Extracting Parametric and Contextual Knowledge with CQA for Low Resource Bangla Language},
author = {Umme Abira Azmary and MD Ikramul Kayes and Swakkhar Shatabda and Farig Yousuf Sadeque},
journal= {arXiv preprint arXiv:2602.01451},
year = {2026}
}