coder-eval

Evaluate, benchmark, and A/B-test AI coding agents (Claude Code, Codex, Gemini/Antigravity) with sandboxed, reproducible YAML task suites.

Installation

In a virtualenv (see these instructions if you need to create one):

pip3 install coder-eval

Dependencies

Releases

Version Released Bullseye
Python 3.9
Bookworm
Python 3.11
Trixie
Python 3.13
Files
0.8.4 2026-07-13
0.8.3 2026-07-09      
0.8.2 2026-07-09      

Issues with this package?

Page last updated 2026-07-13 23:23:59 UTC