BiST: 孟加拉语-英语双语金标准语料库,用于句子结构与时态分类及标注者间一致性
计算与语言
2026-04-07 v1 人工智能
摘要
高质量双语资源仍然是推进低资源设置下多语言 NLP 发展的关键瓶颈,尤其是孟加拉语。为弥补这一差距,我们引入了 BiST,这是一个经过严格整理的孟加拉语-英语双语语料库,用于句子层面的语法分类,标注涵盖两个基本维度:句法结构(简单、复合、并列、复合-并列)和时态(现在、过去、将来)。该语料库来自开放许可的百科来源和自然生成的会话文本,经过系统预处理和自动语言识别,共包含 30,534 个句子,其中 17,465 个英语句子和 13,069 个孟加拉语句子。标注质量通过三阶段框架和三组独立标注者以及按维度划分的 Fleiss Kappa()一致性来保证,结构标注和时间标注分别获得了 值为 0.82 和 0.88 的可靠且可复现的标签。统计分析展示了真实的句法结构和时态分布,而基线评估表明,利用互补语言特定表示的双编码器架构始终优于强大的多语言编码器。除了基准测试外,BiST 提供了明确的语言监督,支持语法建模任务,包括受控文本生成、自动反馈生成和跨语言表示学习。该语料库为双语语法建模建立了统一资源,并促进了基于语言学的多语言研究。
引用
@article{arxiv.2604.04708,
title = {BiST: A Gold Standard Bangla-English Bilingual Corpus for Sentence Structure and Tense Classification with Inter-Annotator Agreement},
author = {Abdullah Al Shafi and Swapnil Kundu Argha and M. A. Moyeen and Abdul Muntakim and Shoumik Barman Polok},
journal= {arXiv preprint arXiv:2604.04708},
year = {2026}
}