Local LLM coding benchmark

Hand-picked coding tasks, run locally via pi + llama-swap, each model repeated to expose flukes. Each run is kept separate.

Show:

Leaderboard

Every model ranked by its mean score across all tasks it was run on. Click a column header to re-sort; use the buttons above to filter local vs cloud.

#ModelTypeAvg scorePass rateTasks
gemma-4-26b-a4b LocalLocal100%24/255
gemma-4-31b@or CloudCloud99%14/153
gemma-4-31b LocalLocal95%27/306
gemma-4-26b-a4b@or CloudCloud92%13/153
qwen3.6-27b LocalLocal90%24/306
qwen3.6-35b-a3b LocalLocal88%24/306
ornith-1.0-35b LocalLocal87%25/306
qwen3.6-35b-a3b@or CloudCloud87%13/153
qwen3.6-27b@or CloudCloud80%12/153
north-mini-code-1.0 LocalLocal80%20/306
bielik-11b-v3 LocalLocal27%5/306

Latest results (merged across runs)

model \ tasklong-context-needlepi-maxtokens-truncationpy-fix-bugpy-refactorpy-store-apiweb-platformerweb-tip-calculator
bielik-11b-v3 Local5/5 · 100%0/5 · 60%0/5 · 0%0/5 · 0%5/5 graded · 0%0/5 · 0%
gemma-4-26b-a4b Local5/5 · 100%5/5 · 100%5/5 · 100%4/5 · 98%0/5 graded5/5 · 100%
gemma-4-26b-a4b@or Cloud5/5 · 100%3/5 · 76%0/5 graded5/5 · 100%
gemma-4-31b Local5/5 · 100%5/5 · 100%5/5 · 100%5/5 · 100%5/5 graded · 70%5/5 · 100%
gemma-4-31b@or Cloud5/5 · 100%4/5 · 98%0/5 graded5/5 · 100%
north-mini-code-1.0 Local4/5 · 93%5/5 · 100%5/5 · 100%1/5 · 66%5/5 graded · 20%5/5 · 100%
ornith-1.0-35b Local5/5 · 100%5/5 · 100%5/5 · 100%4/5 · 93%5/5 graded · 30%5/5 · 100%
qwen3.6-27b Local5/5 · 100%5/5 · 100%5/5 · 100%4/5 · 98%5/5 graded · 40%5/5 · 100%
qwen3.6-27b@or Cloud5/5 · 100%2/5 · 40%0/5 graded5/5 · 100%
qwen3.6-35b-a3b Local5/5 · 100%5/5 · 100%5/5 · 100%4/5 · 98%5/5 graded · 30%5/5 · 100%
qwen3.6-35b-a3b-vision Local0/1 graded
qwen3.6-35b-a3b@or Cloud5/5 · 100%3/5 · 60%0/5 graded5/5 · 100%

Each cell is the newest run that covered that model × task; click it for that run's code, transcript and verify output.

All runs

RunProfileModelsPassWhen (UTC)
2026-07-04T205859Z-session-minimalminimal1ungraded2026-07-04T20:58:59Z
2026-07-02T101616Z-9f192f9-minimalminimal774/852026-07-02T101616Z
2026-06-30T130601Z-3ea440b-minimalminimal470/802026-06-30T130601Z
2026-06-30T073559Z-99ec315-minimalfixed27/92026-06-30T073559Z-99ec315-minimal
2026-06-29T230457Z-99ec315-minimalfixed416/162026-06-29T230457Z-99ec315-minimal
2026-06-29T212443Z-9dd5ff9-minimalminimal114/152026-06-29T212443Z
2026-06-29T114508Z-e0d7de7-minimalminimal625/302026-06-29T114508Z
2026-06-29T100926Z-fa9f1f9-minimalminimal26/202026-06-29T100926Z
2026-06-29T073206Z-8fd0e80-minimalminimal437/402026-06-29T073206Z-8fd0e80-minimal

Notes & findings

Lessons that are not tied to a single run — failure modes, config gotchas — with the raw evidence attached.