Open Source · MarkTechPost ·

Supabase Releases Evals: an Open Source Benchmark That Scores Claude Code, Codex and OpenCode on Real Supabase Tasks

Supabase Releases Evals: an Open Source Benchmark That Scores Claude Code, Codex and OpenCode on Real Supabase Tasks

Supabase released supabase/evals, an Apache-2.0 benchmark for evaluating coding agents such as Claude Code, Codex and OpenCode on real Supabase tasks. It runs tests in containerized environments and scores results using deterministic checks and an LLM judge.

Read the full story at MarkTechPost →