扩展议会语料库:使用 MultiParTweet 进行自动标注与评估
计算与语言
2025-12-15 v1 多媒体
摘要
社交媒体作为现代政治的重要载体,既反映政治家的意识形态,也促进了与年轻一代的沟通。我们提出 MultiParTweet,这是一个来自 X 的多语言推文语料库,将政治家的社交媒体话语与德国政治语料库 GerParCor 相连接,使能够进行在线交流与议会辩论之间的比较分析。MultiParTweet 包含 39,546 条推文,其中包括 19,056 条媒体内容。此外,我们使用九个基于文本的模型和一个视觉语言模型(VLM)对 MultiParTweet 进行情感、情绪和主题标注。此外,对自动标注结果在人工标注的子集上进行评估。我们提供的工具 TTLABTweetCrawler 可用于重建 MultiParTweet,作为一个面向 X 数据收集的框架。为Demonstrate方法论,我们检查这些模型是否能通过剩余模型的输出来预测彼此。在总结中,我们提供 MultiParTweet,这是一个将自动文本和媒体基标注整合并通过人工标注验证的资源,以及 TTLABTweetCrawler,这是一个通用的数据收集工具。我们的分析表明,这些模型是相互可预测的。此外,VLM 基于的标注更受人类标注员的青睐,这表明多模态表示更符合人类的解释。
引用
@article{arxiv.2512.11567,
title = {Extending a Parliamentary Corpus with MPs' Tweets: Automatic Annotation and Evaluation Using MultiParTweet},
author = {Mevlüt Bagci and Ali Abusaleh and Daniel Baumartz and Giueseppe Abrami and Maxim Konca and Alexander Mehler},
journal= {arXiv preprint arXiv:2512.11567},
year = {2025}
}
备注
Submitted to LREC 2026