中文

基于大语言模型循环的神经主题方法用于商业研究

计算与语言 2026-03-05 v1 计量经济学

摘要

非结构化文本在商业研究中的应用日益增长,使主题建模成为从评论、社交媒体和开放式调查响应中构建解释变量的核心工具,但现有方法作为测量仪器效果不佳。先前的研究表明文本内容预测销售额、满意度和企业绩效等结果,但概率模型常生成概念模糊的主题,神经主题模型在理论驱动的情境下难以解释,而大型语言模型方法缺乏标准化、稳定性和与文档级表示的一致性。我们提出 LX Topic,一种神经主题方法,将主题概念化为潜在语言构造,并为经验分析产生校准后的文档级主题比例。LX Topic 基于 FASTopic 确保强文档代表性,并通过对齐和置信度加权机制集成大型语言模型在主题-词水平上的细化,增强语义连贯性而不扰乱文档-主题分布。针对大型亚马逊和 Yelp 评论数据集的评估表明,LX Topic 在整体主题质量方面优于领先模型,同时保持聚类和分类性能。通过统一主题发现、细化和标准化输出于 web 系统中,LX Topic 将主题建模建立为营销研究和实践中可复现、可解释且以测量为导向的仪器。

关键词

引用

@article{arxiv.2603.03623,
  title  = {A Neural Topic Method Using a Large-Language-Model-in-the-Loop for Business Research},
  author = {Stephan Ludwig and Peter J. Danaher and Xiaohao Yang},
  journal= {arXiv preprint arXiv:2603.03623},
  year   = {2026}
}