MGen:数百万自然语境中的泛型句数据集
计算与语言
2025-11-25 v2
摘要
MGen是一个包含超过400万条自然出现的泛型句和量化句的数据集,这些句子提取自多样化的文本来源。数据集中的句子拥有长上下文文档,对应网站和学术论文,并涵盖11种不同的量化词。我们分析了数据集中泛型句的特征,得出了一些有趣的见解:泛型句可以是长句(平均超过16个词),且说话者常使用它们来表达关于人的概括。MGen是规模最大、最多样化的自然泛型句数据集,为大规模泛型计算研究打开了大门。该数据集可在 https://gustavocilleruelo.com/mgen 公开获取。
引用
@article{arxiv.2509.26160,
title = {MGen: Millions of Naturally Occurring Generics in Context},
author = {Gustavo Cilleruelo and Emily Allaway and Barry Haddow and Alexandra Birch},
journal= {arXiv preprint arXiv:2509.26160},
year = {2025}
}
备注
Presented at SCiL 2025