ProxAnn:面向使用的主题模型和文档聚类评估
计算与语言
2025-07-02 v1
摘要
主题模型和文档聚类评估要么使用与人类偏好不一致的自动化指标,要么需要难以扩展的专家标签。我们设计了可扩展的人类评估协议及相应的自动化近似方法,以反映从事者对模型的真实世界用途。评审员——或基于LLM的代理——审查分配给主题或聚类的文本项目,推断该组的类别,然后将该类别应用于其他文档。使用此协议,我们在两个数据集上收集了来自多样化主题模型输出的广泛众包注释。我们随后使用这些注释来验证自动代理,发现最佳LLM代理与人类评审员在统计上不可区分,因此可作为自动化评估的合理替代方案。软件包、Web界面和数据均可在https://github.com/ahoho/proxann 获取。
引用
@article{arxiv.2507.00828,
title = {ProxAnn: Use-Oriented Evaluations of Topic Models and Document Clustering},
author = {Alexander Hoyle and Lorena Calvo-Bartolomé and Jordan Boyd-Graber and Philip Resnik},
journal= {arXiv preprint arXiv:2507.00828},
year = {2025}
}
备注
Accepted to ACL 2025 (Main)