AutoMedBench Full

Leaderboard

Average model performance across all 96 task-tier combinations (48 tasks × Lite/Standard).

Leaderboard 96-task average
Overall = 1/2 Agentic + 1/2 Task
Rank Model Release Overall Agentic Task Avg cost Avg time Avg turns
1
Claude Opus 4.6Anthropic
2026-02-05 73.04 87.97 58.10 $10.49 13.2 min 23.6
2
GLM-5Z.ai
2026-02-12 70.38 85.30 55.47 $2.36 18.3 min 39.3
3
Qwen3.5Alibaba Cloud
2026-02-15 66.43 81.28 51.59 $1.96 14.9 min 31.7
4
Gemini 3.1 ProGoogle
2026-02-19 66.36 80.00 52.72 $4.27 17.2 min 20.9
5
MiniMax M2.5MiniMax
2026-02-12 61.21 76.00 46.43 $2.34 20.5 min 35.0
6
ChatGPT 5.4OpenAI
2026-03-05 56.37 68.35 44.38 $2.75 10.4 min 10.0

Classification · Synthesis · Detection · Segmentation · VQA · Report Generation · Enhancement

Score source ->

Scores and operational metrics are equal-weight averages across all 96 task-tier combinations (48 tasks × Lite/Standard). Cost is USD; time is wall-clock; turns are conversational turns.