民意潜藏:一种基于 Transformer 语言模型的计算社会语言学方法
计算与语言
2022-04-21 v2 计算机与社会
摘要
对社交媒体进行情感、话题及其他分析文本时,最初依赖于所选用的关键词与短语来创建研究语料库。然而,研究者选择的关键词可能鲜少出现,从而导致因小样本使用而产生的误差。本文中,我们利用 GPT 系列等 Transformer 语言模型的记忆、插值与外推能力,在更大的 Yelp 评论语料库中习得某一子群的语言行为。随后,我们使用基于提示的查询生成合成文本,可对其加以分析以产出关于模型所训练人群所持特定观点的洞见。一旦习得,相比传统关键词搜索,可用更高准确度对模型进行更具体的情感查询。我们表明,即使在训练语料中某特定关键短语有限或完全不存在的情况下,GPT 仍能准确生成大量具有正确情感的文本。
引用
@article{arxiv.2204.07483,
title = {Polling Latent Opinions: A Method for Computational Sociolinguistics Using Transformer Language Models},
author = {Philip Feldman and Aaron Dant and James R. Foulds and Shemei Pan},
journal= {arXiv preprint arXiv:2204.07483},
year = {2022}
}
备注
10 pages, 9 figures, 7 tables