BIS Reasoning 1.0:首个大规模日语信念不一致演绎基准
计算与语言
2026-03-17 v5 人工智能
摘要
我们提出BIS Reasoning 1.0,这是首个大规模日语演绎问题数据集,旨在评估大型语言模型(LLM)中的信念不一致演绎。与之前的资源如NeuBAROCO和JFLD侧重于通用或信念一致逻辑不同,BIS Reasoning 1.0系统性地引入逻辑上有效但信念不一致的演绎题,以暴露信念偏差,即模型倾向于接受可信的结论而不顾其有效性。我们在统一的零shot 协议下对代表性一套最新模型进行基准测试,包括OpenAI GPT-5变体、GPT-4o、Qwen以及日本主流LLM。在BIS Reasoning 1.0上,演绎导向的模型几乎实现了完美准确率(例如Qwen3-32B≈99%,GPT-5-mini最高可达≈99.7%),而GPT-4o约为80%。早期的日本专用模型表现不佳,准确率常常低于60%,而最新的llm-jp-3.1-13b-instruct4显著提升至80%中后段水平。这些结果表明,信念不一致输入的鲁棒性更多来自于显式演绎优化,而非语言专业化或规模因素alone。我们的分析进一步表明,即使是顶尖系统在逻辑有效性与直觉或事实信念冲突时也会出错,并且性能对提示设计和推理时推理 effort 敏感。我们讨论了这些发现对安全关键领域的含义,包括法律、医疗和科学文献,在这些领域,严格的逻辑忠诚度必须超过直觉信念,以确保可靠性。
引用
@article{arxiv.2506.06955,
title = {BIS Reasoning 1.0: The First Large-Scale Japanese Benchmark for Belief-Inconsistent Syllogistic Reasoning},
author = {Ha-Thanh Nguyen and Hideyuki Tachibana and Chaoran Liu and Qianying Liu and Su Myat Noe and Koichi Takeda and Sadao Kurohashi},
journal= {arXiv preprint arXiv:2506.06955},
year = {2026}
}
备注
Accepted at LREC 2026