Preprint, 2026
Yuetai Li, Yichen Feng, Zhangchen Xu, Zixian Ma, Kaiyuan Zheng, Fengqing Jiang, Xinghua Sun, Rulin Shao, Zichen Chen, Yue Huang, Xinyang Han, Brian Lee, Kayla Xu, Shenglai Zeng, Hang Hua, Xiangliang Zhang, Basel Alomair, Ranjay Krishna, Luke Zettlemoyer, Pang Wei Koh, Bhaskar Ramasubramanian, Luyao Niu, Xiang Yue, Radha Poovendran
Developed a benchmark of 130 agentic tasks across 35 occupations, evaluating workflows that human experts prioritize for delegation and grading outputs with task-specific rubrics.
Adopted by Meta Muse Spark, Kimi K3, and Qwen3.8