Artificial Intelligence · Computer Science
Beyond Itinerary Planning-A Real-World Benchmark for Multi-Turn and Tool-Using Travel Tasks
Xiang Cheng, Yulan Hu, Xiangwen Zhang, Lu Xu +4
2026-04-22
Artificial Intelligence · Computer Science
Robust Planning with LLM-Modulo Framework: Case Study in Travel Planning
Atharva Gundawar, Mudit Verma, Lin Guan, Karthik Valmeekam +2
2024-06-03
Computation and Language · Computer Science
GroupTravelBench: Benchmarking LLM Agents on Multi-Person Travel Planning
Xiang Cheng, Yulan Hu, Lulu Zheng, Zheng Pan +2
2026-05-26
Artificial Intelligence · Computer Science
Revisiting the Travel Planning Capabilities of Large Language Models
Bo-Wen Zhang, Jin Ye, Peng-Yu Hua, Jia-Wei Cao +3
2026-05-06
Computation and Language · Computer Science
SLM-Bench: A Comprehensive Benchmark of Small Language Models on Environmental Impacts--Extended Version
Nghiem Thanh Pham, Tung Kieu, Duc-Manh Nguyen, Son Ha Xuan +2
2025-09-05
Computation and Language · Computer Science
PlanBench: An Extensible Benchmark for Evaluating Large Language Models on Planning and Reasoning about Change
Karthik Valmeekam, Matthew Marquez, Alberto Olmo, Sarath Sreedharan +1
2023-11-28
Artificial Intelligence · Computer Science
ACPBench: Reasoning about Action, Change, and Planning
Harsha Kokel, Michael Katz, Kavitha Srinivas, Shirin Sohrabi
2026-03-03
Artificial Intelligence · Computer Science
ItinBench: Benchmarking Planning Across Multiple Cognitive Dimensions with Large Language Models
Tianlong Wang, Pinqiao Wang, Weili Shi, Sheng li
2026-03-23
Computation and Language · Computer Science
Enterprise Benchmarks for Large Language Model Evaluation
Bing Zhang, Mikio Takeuchi, Ryo Kawahara, Shubhi Asthana +4
2024-10-18
Artificial Intelligence · Computer Science
TripScore: Benchmarking and rewarding real-world travel planning with fine-grained evaluation
Yincen Qu, Huan Xiao, Feng Li, Gregory Li +3
2025-10-17
Computation and Language · Computer Science
FlowBench: Revisiting and Benchmarking Workflow-Guided Planning for LLM-based Agents
Ruixuan Xiao, Wentao Ma, Ke Wang, Yuchuan Wu +4
2024-06-24
Machine Learning · Computer Science
From Passive to Active Reasoning: Can Large Language Models Ask the Right Questions under Incomplete Information?
Zhanke Zhou, Xiao Feng, Zhaocheng Zhu, Jiangchao Yao +2
2025-06-11
Machine Learning · Computer Science
Large Language Models for Travel Behavior Prediction
Baichuan Mo, Hanyong Xu, Ruoyun Ma, Jung-Hoon Cho +3
2026-03-12
Computation and Language · Computer Science
A Challenging Benchmark for Low-Resource Learning
Yudong Wang, Chang Ma, Qingxiu Dong, Lingpeng Kong +1
2023-03-10
Computation and Language · Computer Science
OptimalThinkingBench: Evaluating Over and Underthinking in LLMs
Pranjal Aggarwal, Seungone Kim, Jack Lanchantin, Sean Welleck +3
2025-10-07
Artificial Intelligence · Computer Science
AgentBench: Evaluating LLMs as Agents
Xiao Liu, Hao Yu, Hanchen Zhang, Yifan Xu +18
2025-10-07
Machine Learning · Computer Science
RouterBench: A Benchmark for Multi-LLM Routing System
Qitian Jason Hu, Jacob Bieker, Xiuyu Li, Nan Jiang +4
2024-03-29
Artificial Intelligence · Computer Science
GR-Ben: A General Reasoning Benchmark for Evaluating Process Reward Models
Zhouhao Sun, Xuan Zhang, Xiao Ding, Bibo Cai +9
2026-05-08
Computation and Language · Computer Science
Towards Sustainable NLP: Insights from Benchmarking Inference Energy in Large Language Models
Soham Poddar, Paramita Koley, Janardan Misra, Sanjay Podder +2
2025-03-18