# Hard agentic benchmark (multi-turn tool loop) — 2026-07-03 19:09 Real tool execution with results fed back; thinking enabled. | Model | Overall | Seq | Parallel | Chain | Select | Recover | Abstain | Honesty | |---|--:|:--:|:--:|:--:|:--:|:--:|:--:|:--:| | `glm-4.7-flash` | **100%** | 1 | 1 | 1 | 1 | 1 | 1 | 1 | | `gemma4:26b` | **86%** | 1 | 1 | 1 | 1 | 0 | 1 | 1 | | `qwen3.6:35b-a3b` | **86%** | 1 | 1 | 1 | 1 | 0 | 1 | 1 | | `qwen3-coder:30b` | **86%** | 1 | 1 | 0 | 1 | 1 | 1 | 1 | | `gpt-oss:20b` | **71%** | 1 | 1 | 1 | 1 | 0 | 1 | 0 |