Public benchmark

AgentArk Bench on Kaggle

AgentArk Hub no longer maintains a separate leaderboard. Kaggle Bench is the canonical public result surface.

Open Kaggle Bench
14benchmark tasks9evaluated models
#1GPT-5.579%
#2GPT-5.6 Sol79%
#3Gemini 3.8 Flash72%
#4Claude Opus 568%
#5Gemini 3.5 Flash50%
#6Claude Opus 4.849%
#7Gemini 3 Flash Preview40%
#8Grok 4.20 Reasoning32%
#9Grok 4.60%

Snapshot refreshed Sep 7, 2026, 9:55 AM. Follow the Kaggle link for live task-level results and benchmark details.