K-FinHallu: 面向韩国金融领域多轮 RAG 的 hallucination 检测基准
机器学习
2026-05-29 v1
摘要
大型语言模型 (LLM) 通过检索增强生成 (RAG) 推进金融自动化,但 hallucination 仍是高风险环境部署的关键障碍。现有基准关注单轮、以英语为中心的任务,未能覆盖韩国金融领域的多轮动态和语言-监管细微差别。我们引入 K-FinHallu,首个针对韩国金融 RAG 多轮 hallucination 检测基准。我们从真实韩国金融文件构建多轮对话,在基于上下文可回答性的分层分类学框架下注入 hallucination,该框架显式考虑合理拒绝情形。基准测试前沿和开源 LLM 作为 hallucination 检测器,发现即便是最强模型也在细粒度金融诊断和拒绝行为方面仍感困难。对 8B 模型在训练集上微调后,性能可与前沿 LLM 相当,但在所有评估模型中,合理拒绝仍是最弱的维度。
关键词
引用
@article{arxiv.2605.29523,
title = {K-FinHallu: A Hallucination Detection Benchmark for Multi-Turn RAG in Korean Finance},
author = {Eunbyeol Cho and Yunseung Lee and Mirae Kim and Jeewon Yang and Youngjun Kwak and Edward Choi},
journal= {arXiv preprint arXiv:2605.29523},
year = {2026}
}