中文

BIASEDTALES-ML:用于分析LLM生成故事中叙事属性分布的多语言数据集

计算与语言 2026-04-21 v1

摘要

大型语言模型(LLM)日益增长地用于生成叙事性内容,包括儿童故事,后者在社会和文化学习中发挥重要作用。尽管对AI安全和对齐日益关注,但大多数现有评估主要聚焦于英文,导致对对齐行为在跨语言泛化上的探索不足。在本工作中,我们引入BiasedTales-ML,这是一个约35万个儿童故事的大规模平行语料库,覆盖八种类型和文化多样化的语言,采用全排列提示设计。我们提出了结构化的生成器-抽取管道和多维分布分析框架,以检验叙事属性在不同语言、模型和社会条件下的分布情况。我们的分析揭示了叙事生成模式在跨语言上的显著差异,表明在英文中观察到的分布特性在其他语言中并不总是呈现类似特征,特别是在资源较少的语言环境中。就叙事层面而言,我们确定了涉及角色、场景和主题聚焦的持续性结构模式,这些模式在不同的语言情境中呈现不同形式。这些发现凸显了以英文为中心的评估在描述多语言情境下社会导向的叙事生成方面的局限性。我们发布了数据集、代码以及一个交互式可视化工具,以支持未来在多语言叙事分析和评估方面的研究。

关键词

引用

@article{arxiv.2604.17008,
  title  = {BIASEDTALES-ML: A Multilingual Dataset for Analyzing Narrative Attribute Distributions in LLM-Generated Stories},
  author = {Yuxuan Ouyang and yingfeng luo and JingBo Zhu and Tong Xiao},
  journal= {arXiv preprint arXiv:2604.17008},
  year   = {2026}
}

备注

Accepted to ACL 2026 Findings. Data are available at https://huggingface.co/spaces/Linyuana/BIASEDTALES-ML