Variationist:探索书面语言数据中的多维变异与偏差
计算与语言
2024-06-26 v1
摘要
探索和理解语言数据是处理人类语言领域的基本步骤,允许 NLP 实践者在训练前揭示数据中的质量问题和有害偏差,有助于语言学家和社会科学家洞察语言使用和人类行为。然而,目前缺乏一个统一且可定制的工具,能够无缝检查和可视化语言在多个变量、语言单元和超越描述性统计的多样化指标之间的变异和偏差。本文我们介绍了 Variationist,一个高度模块化、可扩展且与任务无关的工具,填补了这一空白。Variationist 能够同时处理在语言单元选择器下,对多样性和关联指标方面的可组合变量类型和语义,并编排创建最多五维度的交互式图表,涵盖超过 30 种变量类型-语义组合。通过在计算方言学、人类标签变异和文本生成方面的案例研究,我们展示了 Variationist 如何使来自不同学科的研究者能够轻松回答特定研究问题或揭示语言数据中的不希望的关联。我们公开了 Python 库、代码、文档和教程供研究社区使用。
引用
@article{arxiv.2406.17647,
title = {Variationist: Exploring Multifaceted Variation and Bias in Written Language Data},
author = {Alan Ramponi and Camilla Casula and Stefano Menini},
journal= {arXiv preprint arXiv:2406.17647},
year = {2024}
}
备注
ACL 2024 (System Demonstrations)