中文

基于凸拓扑与大语言模型探索抗衰老文献

机器学习 2026-02-25 v1 人工智能 计算与语言

摘要

生物医学文献的快速扩张为组织知识并检测新兴趋势带来了挑战,凸显了需要可扩展且可解释方法的需求。K-means 或 LDA 等常见聚类和主题建模方法对初始化敏感且易陷入局部最优,限制了可重复性和评估。我们提出了一种基于凸优化聚类算法的重新表述,产生稳定、精细的主题,通过从数据中选择 exemplar 并保证全局最优。该方法应用于约 12,000 篇关于衰老与延寿的 PubMed 文章,发现经医学专家验证的主题。其结果涵盖从分子机制到饮食补剂、体育活动和肠道菌群等多个方面。该方法表现良好,最重要的是,其可重复性和可解释性区别于 K-means、LDA 和 BERTopic 等常见聚类方法。这一工作为 developing scalable、面向 web 的知识发现工具奠定了基础。

关键词

引用

@article{arxiv.2602.20224,
  title  = {Exploring Anti-Aging Literature via ConvexTopics and Large Language Models},
  author = {Lana E. Yeganova and Won G. Kim and Shubo Tian and Natalie Xie and Donald C. Comeau and W. John Wilbur and Zhiyong Lu},
  journal= {arXiv preprint arXiv:2602.20224},
  year   = {2026}
}