BanglaSummEval:面向孤矛盾性 Bangla 总结的无参考事实一致性评估
计算与语言
2026-02-20 v1
摘要
评估事实一致性对于可靠的文本总结至关重要,尤其是在医疗和新闻等高风险领域。然而,大多数现有评估指标忽略了孤拉语(Bangla),这是一种广泛使用但资源不足的语言,常常依赖参考摘要。我们引入 BanglaSummEval,一个无参考、基于问答的框架,用于评估孤拉语总结的事实一致性。该方法通过从源文档和摘要中自动生成的问答来评估事实准确性和内容覆盖。单个多语言指令调优语言模型处理问生成、问答、候选答案提取和问答重要性加权。这一统一设计减少了系统复杂性和计算成本。为捕捉表面重叠之外的语义一致性,我们使用 BERTScore-Recall 进行答案比较。我们在 300 个人工编写的教育和医疗领域摘要上验证了 BanglaSummEval,显示其与专家人类判断之间的强相关性(Pearson's , Spearman's )。通过提供可解释的分步诊断以及可靠的评估分数,BanglaSummEval 为低资源语言环境中的事实一致性评估提供了实用且透明的解决方案。
引用
@article{arxiv.2602.16843,
title = {BanglaSummEval: Reference-Free Factual Consistency Evaluation for Bangla Summarization},
author = {Ahmed Rafid and Rumman Adib and Fariya Ahmed and Ajwad Abrar and Mohammed Saidul Islam},
journal= {arXiv preprint arXiv:2602.16843},
year = {2026}
}
备注
Accepted in 2nd LoResLM at EACL 2026