面向实时叙事演化监控的在线密度基聚类
计算与语言
2026-02-11 v2
摘要
自动化的社交媒体叙事智能系统在处理连续数据流时,依赖批量聚类方法面临显著的可扩展性挑战。我们研究替换离线 HDBSCAN 为在线密度基聚类算法,以适应生产级叙事报告生成管道中处理大规模多语言社交媒体数据的需求。虽然 HDBSCAN 有效发现层次聚类并处理噪声,但其批处理性质要求每次时间窗口重新训练,从而限制了可扩展性和实时适应性。我们评估了在聚类质量、计算效率、内存占用和与下游叙事提取集成方面的在线聚类方法。我们的评估结合了标准聚类指标、叙事特定措施和人类验证,以评估结构质量和语义可解释性。使用在乌克兰信息空间中历史数据上的滑动窗口仿真实验揭示了在时间稳定性和叙事连贯性之间的权衡,DenStream 获得了最佳的整体性能。这些发现弥合了批处理导向聚类方法与大规模叙事监控系统流式需求之间的鸿沟。
引用
@article{arxiv.2601.20680,
title = {Online Density-Based Clustering for Real-Time Narrative Evolution Monitorin},
author = {Ostap Vykhopen and Viktoria Skorik and Maksym Tereshchenko and Veronika Solopova},
journal= {arXiv preprint arXiv:2601.20680},
year = {2026}
}