Splits!面向大规模社会文化语言学调查的灵活工具
计算与语言
2026-04-10 v3 人工智能
摘要
语言使用的变异受说话者的社会文化背景及具体使用情境的影响,为洞察文化视角、价值观和观点提供了丰富的视角。例如,中国学生讨论“健康饮食”时会使用“timing(定时)”、“regularity(规律)”和“digestion(消化)”等词汇,而美国人则使用“balancing food groups(平衡食物种类)”和“avoiding fat and sugar(避免脂肪和糖)”等词汇,反映了不同文化对营养的不同模型。计算语言学中对这些社会文化语言现象(Sociocultural Linguistic Phenomena, SLP)的研究传统上通过针对特定群体或特定话题的定制化分析来实现,需要专业的数据收集和实验操作化——这一过程不利于快速的假设探索和原型设计。为此,我们提出构建一个“沙箱”,用于系统且灵活的社会语言学研究。通过我们的方法,我们构建了一个基于人口统计学和主题划分的 Reddit 数据集,命名为 Splits!,该数据集通过自我认同标识和复制既有文献中若干已知 SLP 来进行验证。我们展示了该沙箱的实用性,通过一个可扩展的两阶段流程,对大量“潜在” SLP(PSLP)进行筛选,以筛选出最具深度调查价值的优质候选对象。
关键词
引用
@article{arxiv.2504.04640,
title = {Splits! Flexible Sociocultural Linguistic Investigation at Scale},
author = {Eylon Caplan and Tania Chakraborty and Dan Goldwasser},
journal= {arXiv preprint arXiv:2504.04640},
year = {2026}
}
备注
Accepted to ACL 2026 Main Conference