BHRAM-IL:面向多语言印度语言的幻觉识别与评估基准
计算与语言
2025-12-02 v1 人工智能
新兴技术
摘要
大型语言模型 (LLM) 正在越来越多地用于多语言应用中,但常常生成看似合理却不正确或误导性的输出,称为幻觉。虽然幻觉检测在英语方面已有大量研究,但针对资源不足的印度语言仍基本未探索。我们提出了 BHRAM-IL,面向多语言印度语言的幻觉识别与评估基准,覆盖印地语、古地亚语、马拉拉语、奥利亚语以及英语。该基准包含 36,047 个覆盖事实、数值、推理和语言任务的九个类别的精选问题。我们在 10,265 个问题的子集上评估了 14 个最先进的多语言 LLM,分析了跨语言和事实幻觉在语言、模型、规模、类别和领域之间的情况。使用归一化到 (0,1) 范围的类别特定指标进行评估。所有类别和模型的聚合结果给出主要得分 0.23 和语言校正的模糊得分 0.385,表明 BHRAM-IL 对幻觉聚焦评估具有实用价值。该数据集及生成和评估代码已在 GitHub (https://github.com/sambhashana/BHRAM-IL/) 和 HuggingFace (https://huggingface.co/datasets/sambhashana/BHRAM-IL/) 上提供,以支持未来在多语言幻觉检测与缓解方面的研究。
引用
@article{arxiv.2512.01852,
title = {BHRAM-IL: A Benchmark for Hallucination Recognition and Assessment in Multiple Indian Languages},
author = {Hrishikesh Terdalkar and Kirtan Bhojani and Aryan Dongare and Omm Aditya Behera},
journal= {arXiv preprint arXiv:2512.01852},
year = {2025}
}
备注
Accepted at BHASHA Workshop @ IJCNLP/AACL 2025