探索用户生成餐食日志的计算表示与分类方法
机器学习
2025-09-09 v1
摘要
本研究检验了机器学习及其在患者生成健康数据(以自由文本餐食日志形式呈现)上的领域特定丰富化手段,旨在将餐食分类为符合不同营养目标的程度。我们使用来自美国一座大城市中来自114名来自低收入社区的患者收集的超过3000条餐食记录的数据集。注册营养师提供的专家判断用于作为评估的金标准。我们采用文本嵌入技术,包括 TFIDF 和 BERT,以及领域特定丰富化信息,包括本体、食材解析器和微量营养素含量作为输入,评估了逻辑回归和多层感知器分类器的性能,依据准确率、精确率、召回率和 F1 分数与金标准及自我评估进行比较。即使不进行丰富化,机器学习也优于个人对自身记录的评估,最佳的机器学习分类器与丰富化组合实现了更高的准确率。总体而言,结合解析食材、食物实体和微量营养素信息的机器学习分类器在多个营养目标上表现良好,但在不同营养目标上,丰富化和分类算法对分类准确率的影响存在差异。在结论方面,机器学习可可靠地对非结构化的自由文本餐食日志进行分类,以判断餐食是否符合特定营养目标,尤其是在融入营养领域知识后效果更佳。我们的发现凸显了机器学习分析患者生成健康数据的潜力,以支持精密医疗中的以患者为中心的营养指导。
引用
@article{arxiv.2509.06330,
title = {Exploring approaches to computational representation and classification of user-generated meal logs},
author = {Guanlan Hu and Adit Anand and Pooja M. Desai and Iñigo Urteaga and Lena Mamykina},
journal= {arXiv preprint arXiv:2509.06330},
year = {2025}
}