利用 LLM 从芬兰卡累利阿难民访谈中提取社会联系
计算与语言
2025-02-20 v1
摘要
我们对 89,339 份简短的芬兰语访谈历史合集进行了零样本信息提取研究,这些访谈对象为二战后从芬兰东卡累利阿重新安置的难民家庭。我们的研究目标有两个方面。首先,我们旨在从访谈的自由文本中分别提取每个家庭成员的社会组织和爱好。这些可作为指示难民在新环境中社会融入程度的代理变量。其次,我们旨在评估完成该任务的几种替代方法,比较多种生成模型与一种监督学习方法,以更深入地了解这些不同方法的相对优势及其在类似研究中的适用性。我们发现,最佳的生成模型(GPT-4)的表现与人类水平大致相当,F1 分数为 88.8%。有趣的是,最佳的开源生成模型(Llama-3-70B-Instruct)达到了几乎相同的性能,F1 分数为 87.7%,这表明即使在非英语数据上,开源模型也正成为某些实际任务的可行替代方案。此外,我们测试了一种监督学习替代方案,即使用 GPT-4 生成的训练数据微调一个芬兰语 BERT 模型(FinBERT)。通过这种方法,我们在 6K 访谈数据下达到了 84.1% 的 F1 分数,在 30k 访谈数据下达到了 86.3% 的 F1 分数。在计算资源有限或存在大量数据需要处理的情况下,这种方法将特别具有吸引力。
引用
@article{arxiv.2502.13566,
title = {Extracting Social Connections from Finnish Karelian Refugee Interviews Using LLMs},
author = {Joonatan Laato and Jenna Kanerva and John Loehr and Virpi Lummaa and Filip Ginter},
journal= {arXiv preprint arXiv:2502.13566},
year = {2025}
}
备注
Published at Proceedings of Fifth Conference on Computational Humanities Research (CHR'2024), December 2024 https://ceur-ws.org/Vol-3834/paper52.pdf