语码转换话语中的主题与社会语言学变异建模:来自西班牙语-英语和西班牙语-瓜拉尼语的见解
计算与语言
2025-12-04 v1
摘要
本研究提出了一种LLM辅助的注释流程,用于两种类型学上不同语境(西班牙语-英语和西班牙语-瓜拉尼语)中双语话语的社会语言学与主题分析。使用大语言模型,我们自动标记了总共3,691个语码转换句子的主题、体裁和话语-语用功能,整合了迈阿密双语语料库的人口统计元数据,并用新的主题注释丰富了西班牙语-瓜拉尼语数据集。由此产生的分布揭示了迈阿密数据中性别、语言优势和话语功能之间的系统性联系,以及巴拉圭文本中正式瓜拉尼语和非正式西班牙语之间明确的diglossic划分。这些发现以语料库规模的定量证据复制并扩展了早期的互动和社会语言学观察。该研究表明,大语言模型可以可靠地恢复传统上仅通过手动注释才能获得的可解释社会语言学模式,推进了跨语言和低资源双语研究的计算方法。
引用
@article{arxiv.2512.03334,
title = {Modeling Topics and Sociolinguistic Variation in Code-Switched Discourse: Insights from Spanish-English and Spanish-Guaran\'i},
author = {Nemika Tyagi and Nelvin Licona Guevara and Olga Kellert},
journal= {arXiv preprint arXiv:2512.03334},
year = {2025}
}
备注
10 pages, 4 figures