超越事实性问答:基于长文本多语言内容的导师导师式问答
计算与语言
2026-01-27 v1 人工智能
摘要
问答系统通常在事实正确性方面进行评估,但许多现实应用(如教育和职业指导)需要导师式回答:提供反思和指导。现有QA基准几乎不捕捉这一区别,尤其是在多语言和长文本环境中。我们引入MentorQA,这是首个针对导师导师式问答的多语言数据集和评估框架,涵盖来自四种语言、180小时内容近9000个问答对。我们定义的导师导师式评估维度超越事实准确性,捕捉清晰度、对齐性和学习价值。使用MentorQA,我们在受控条件下比较了单智能体、双智能体、RAG和多智能体QA架构。多智能体管道在生成高质量导师式回答方面 consistently 表现更好,尤其在复杂主题和低资源语言方面 gains 尤为显著。我们进一步分析了基于LLM的自动评估可靠性,观察到其与人类判断之间的显著差异。总体而言,本工作确立了导师导师式QA作为一个独立的研究问题,并为研究教育AI中的agentic架构和评估设计提供了多语言基准。该数据集和评估框架已发布于 https://github.com/AIM-SCU/MentorQA。
引用
@article{arxiv.2601.17173,
title = {Beyond Factual QA: Mentorship-Oriented Question Answering over Long-Form Multilingual Content},
author = {Parth Bhalerao and Diola Dsouza and Ruiwen Guan and Oana Ignat},
journal= {arXiv preprint arXiv:2601.17173},
year = {2026}
}