RespondeoQA:一个双语拉丁语-英语问答基准
计算与语言
2026-04-23 v1
摘要
我们引入了一个用于双语拉丁语和英语环境下的问答与翻译的基准数据集,包含约 7,800 个问答对。问题来源于拉丁语教学资料,包括考试、知识竞赛式问答以及从 19 世纪至今的教科书。经过自动提取、清洗和人工审核,该数据集涵盖了多种问题类型:基于知识和技能的、多跳推理的、约束翻译的以及混合语言对的。据我们所知,这是首个以拉丁语为中心的问答基准。作为案例研究,我们评估了三个大型语言模型——LLaMa 3、Qwen QwQ 和 OpenAI 的 o3-mini——发现它们在技能导向型问题上的表现都更差。尽管推理模型在韵律分析和文学手法任务上表现更好,但整体提升有限。QwQ 在用拉丁语提问的问题上表现略好,但 LLaMa3 和 o3-mini 的表现更依赖于任务类型。该数据集为评估模型在特定语言文化领域的能力提供了新资源,其创建过程可以轻松适应其他语言。数据集可在以下地址获取:https://github.com/slanglab/RespondeoQA
引用
@article{arxiv.2604.20738,
title = {RespondeoQA: a Benchmark for Bilingual Latin-English Question Answering},
author = {Marisa Hudspeth and Patrick J. Burns and Brendan O'Connor},
journal= {arXiv preprint arXiv:2604.20738},
year = {2026}
}
备注
Published in LREC 2026