From Measurement Instruments to Data: Leveraging Theory-Driven Synthetic Training Data for Classifying Social Constructs
计算与语言
2024-12-11 v3 计算机与社会
摘要
计算文本分类是一项具有挑战性的任务,尤其是对于多维社会结构而言。最近,越来越多的人讨论合成训练数据是否可以通过提供这些结构在文本中表示的示例来增强分类。在本文中,我们系统性地检验了以理论为导驱动的合成训练数据在提高社会结构测量方面的潜力。具体而言,我们探讨了研究者如何将社会科学中的测量仪器(如调查量表或注释手册)中的既定知识转化为理论驱动的合成数据生成。使用两个关于衡量仇女气和政治话题的研究,我们评估了合成训练数据对微调文本分类模型的增值作用。虽然仇女气研究的结果不太令人鼓舞,但我们的发现表明,合成数据在减少政治话题分类所需的标记数据方面非常有效。仅通过最小的性能下降,合成数据允许用以取代大量标记数据。此外,理论驱动的合成数据在有概念信息而生成的数据方面表现出显著的优势。
引用
@article{arxiv.2410.12622,
title = {From Measurement Instruments to Data: Leveraging Theory-Driven Synthetic Training Data for Classifying Social Constructs},
author = {Lukas Birkenmaier and Matthias Roth and Indira Sen},
journal= {arXiv preprint arXiv:2410.12622},
year = {2024}
}