通过参与度量度社会整合:使用大语言模型对 displaced Karelians Interview Archive中的组织与休闲活动进行分类
计算与语言
2026-02-18 v1
摘要
数字化历史档案库使得可以大规模研究日常社会生活,但从文本中直接提取的信息往往不允许直接回答历史学家或社会学家提出的定性问题。我们在一个大型芬兰二战迁徙的卡列利亚家庭访谈集合中解决了这一问题。先前的工作从这些访谈中提取了超过35万次休闲活动和组织成员资格提及,产生了7.1万个唯一活动和组织名称—— far too many to analyze directly。我们开发了一个捕获参与关键方面的分类框架,包括活动/组织的类型、其社交性、发生频率以及体能需求。我们标注了一个金标准数据集以允许可靠的评估,然后测试大语言模型是否能够按比例应用相同的模式。通过在多个模型运行中进行简单投票,我们发现开源大语言模型可以与专家判断相近。最后,我们将该方法应用于标记35万个实体,产生一个结构化资源,用于下游社会整合及相关结果的研究。
引用
@article{arxiv.2602.15436,
title = {Measuring Social Integration Through Participation: Categorizing Organizations and Leisure Activities in the Displaced Karelians Interview Archive using LLMs},
author = {Joonatan Laato and Veera Schroderus and Jenna Kanerva and Jenni Kauppi and Virpi Lummaa and Filip Ginter},
journal= {arXiv preprint arXiv:2602.15436},
year = {2026}
}
备注
Presented at: The 10th Joint SIGHUM Workshop on Computational Linguistics for Cultural Heritage, Social Sciences, Humanities and Literature; EACL 2026 Workshop