#benchmark

1 本の記事。

AIコーディング比較は読むより測る——ローカルLLM3種をpytestで採点した

macOS 26.6.1 · arm64 · 検証コマンド 13 本 · 2026-08-17

同一6問を pytest で採点。7b が 5/6、1.5b が 4/6、deepseek 1.3b は 1/6

AIコーディングツールの比較記事は料金表とベンチ引用ばかりで、自分のタスクでの実力が分からない。同一プロンプト・pytest自動採点のハーネスを自作し、無料のローカルLLM3モデルの合格率と落ちたコードを実測した。