EvoTaxo:基于社交媒体流构建与演化的分类学
计算与语言
2026-03-23 v1
摘要
从社交媒体语料库构建分类学具有挑战性,因为帖子短小、噪声多、语义交织且具有时序动态特性。现有分类学 induction 方法主要为静态语料库设计,往往难以在鲁棒性、可扩展性和对演化话语敏感性之间取得平衡。我们提出了 EvoTaxo,一个基于大语言模型(LLM)的框架,用于从时序有序的社交媒体流中构建和演化分类学。EvoTaxo 不直接聚类原始帖子,而是将每个帖子转换为对当前分类学的结构化草案动作,随后在时间窗口内累积结构证据,通过双视图聚类整合语义相似性与时序局部性来确定候选编辑。随后,采用精炼与仲裁程序筛选可靠编辑后再执行;每个节点维护概念记忆库以保留时间内的语义边界。实验在两个 Reddit 语料库上进行,结果显示 EvoTaxo 产生的分类学比基线更均衡,帖子到叶子节点的分配更清晰,在相当于基线的分类学规模下实现更好的语料库覆盖率和更强的结构质量。对 Reddit 社区 /r/ICE_Raids 的案例研究进一步表明,EvoTaxo 捕捉到了话语的有意义时序变化。我们的 codebase 已在此处提供。
关键词
引用
@article{arxiv.2603.19711,
title = {EvoTaxo: Building and Evolving Taxonomy from Social Media Streams},
author = {Yiyang Li and Tianyi Ma and Yanfang Ye},
journal= {arXiv preprint arXiv:2603.19711},
year = {2026}
}