CLI benchmarks, measured release over release
You can't trust a scanner that doesn't measure itself. Every Vibgrate CLI release runs the same pinned benchmark suite as the release before it — scan correctness, code-graph extraction across 19 languages, retrieval accuracy, supply-chain correctness, and performance — and publishes the comparison here, regressions included.
Latest release — v2026.814.2 vs v2026.814.1
| Metric | v2026.814.1 | v2026.814.2 | Change |
|---|---|---|---|
| Languages with extraction | 19 | 19 | no change |
| Definitions extracted (corpus total) | 21,790 | 21,790 | no change |
| Call edges extracted (corpus total) | 11,110 | 11,110 | no change |
| Locate accuracy (top-1) | 93.8% | 93.8% | no change |
| Locate quality (XL corpus resolved) | 100.0% | 100.0% | no change |
| Ask quality (seed relevance, full corpus) | 100.0% | 100.0% | no change |
| DI resolution (all languages) | 76.2% | 76.2% | no change |
| Dependency detection (authored manifest truth) | 96.4% | 96.4% | no change |
| CLI startup (--version, median) | 620.2ms | 616.5ms | no significant change |
| Token reduction vs baseline agent (equal success) | 22.6% | 40.7% | +18.1pp |
2 regressions in this release
- Tasks passed on both arms: 33 → 31 (-6.1%) — under investigation
- Comparable-task rate (both arms passed / total): 94.3% → 88.6% (-6.1%) — under investigation
Measured on the release profile (fast per-release subset), corpus 2026.08-2, 189 metrics compared — both versions run interleaved on the same machine against the identical pinned corpus.
Language coverage — code-graph extraction
Per-language extraction and retrieval on the pinned corpus, with change since the previous release. Definitions and call edges are the reliable coverage signal; locate top-1 is how often the first answer to a ground-truth lookup is the right one.
| Language | Definitions | Call edges | Parse rate | Locate top-1 |
|---|---|---|---|---|
| Shell | 665 | 198 | 100.0% | 94.4% |
| C | 673 | 199 | 100.0% | 95.6% |
| C++ | 714 | 182 | 100.0% | 94.4% |
| C# | 1,064 | 289 | 100.0% | 92.2% |
| Dart | 661 | 212 | 100.0% | 95.6% |
| Elixir | 693 | 184 | 100.0% | 94.4% |
| Go | 883 | 338 | 100.0% | 100.0% |
| Java | 1,010 | 204 | 100.0% | 85.6% |
| JavaScript | 685 | 229 | 100.0% | 92.2% |
| Kotlin | 661 | 195 | 100.0% | 92.2% |
| Lua | 652 | 102 | 100.0% | 97.8% |
| PHP | 658 | 181 | 100.0% | 93.3% |
| Python | 1,560 | 146 | 100.0% | 87.8% |
| Ruby | 674 | 1 | 100.0% | 94.4% |
| Rust | 1,062 | 610 | 100.0% | 95.6% |
| Scala | 687 | 192 | 100.0% | 96.7% |
| Swift | 691 | 176 | 100.0% | 97.8% |
| TypeScript | 7,438 | 7,268 | 100.0% | 85.4% |
| Zig | 659 | 204 | 100.0% | 96.7% |
Previous reports
- v2026.814.1vs v2026.813.1 — 2 regressions across 189 metrics2026-08-14
- v2026.813.1vs v2026.807.1 — 2 regressions across 189 metrics2026-08-13
- v2026.807.1vs v2026.806.2 — 2 regressions across 189 metrics2026-08-10
- v2026.806.3vs v2026.806.2 — 2 regressions across 189 metrics2026-08-06
- v2026.806.2vs v2026.806.1 — 2 regressions across 189 metrics2026-08-06
- v2026.806.1vs v2026.805.2 — 2 regressions across 189 metrics2026-08-06
- v2026.805.2vs v2026.805.1 — 2 regressions across 189 metrics2026-08-05
- v2026.805.1vs v2026.804.1 — 2 regressions across 189 metrics2026-08-05
- v2026.804.1vs v2026.803.5 — 2 regressions across 189 metrics2026-08-04
- v2026.803.5vs v2026.803.4 — 2 regressions across 189 metrics2026-08-03
- v2026.803.4vs v2026.803.3 — 2 regressions across 189 metrics2026-08-03
- v2026.803.3vs v2026.803.1 — 3 regressions across 189 metrics2026-08-03
- v2026.801.1vs v2026.731.3 — 21 regressions across 182 metrics2026-08-01
- v2026.731.3vs v2026.731.2 — no regressions across 176 metrics2026-07-31
- v2026.731.2vs v2026.731.1 — no regressions across 176 metrics2026-07-31
- v2026.731.1vs v2026.730.2 — no regressions across 176 metrics2026-07-31
- v2026.730.2vs v2026.730.1 — no regressions across 176 metrics2026-07-30
- v2026.730.1vs v2026.729.3 — no regressions across 176 metrics2026-07-30
- v2026.729.3vs v2026.729.2 — no regressions across 176 metrics2026-07-29
- v2026.729.2vs v2026.729.1 — no regressions across 176 metrics2026-07-29
- v2026.729.1vs v2026.728.5 — no regressions across 176 metrics2026-07-29
- v2026.728.5vs v2026.728.4 — no regressions across 176 metrics2026-07-28
- v2026.728.4vs v2026.728.3 — 3 regressions across 176 metrics2026-07-28
- v2026.728.3vs v2026.728.2 — no regressions across 176 metrics2026-07-28
- v2026.728.2vs v2026.727.4 — no regressions across 176 metrics2026-07-28
- v2026.727.4vs v2026.727.3 — no regressions across 176 metrics2026-07-27
- v2026.727.3vs v2026.727.2 — 1 regression across 176 metrics2026-07-27
- v2026.727.2vs v2026.727.1 — no regressions across 176 metrics2026-07-27
- v2026.727.1vs v2026.722.2 — no regressions across 176 metrics2026-07-27
- v2026.722.2vs v2026.722.1 — no regressions across 176 metrics2026-07-22
- v2026.722.1vs v2026.721.3 — no regressions across 176 metrics2026-07-22
- v2026.721.3vs v2026.721.2 — 3 regressions across 176 metrics2026-07-21
- v2026.721.2vs v2026.721.1 — no regressions across 164 metrics2026-07-21
- v2026.721.1vs v2026.720.4 — no regressions across 164 metrics2026-07-21
- v2026.720.4vs v2026.720.3 — no regressions across 157 metrics2026-07-20
- v2026.720.3vs v2026.720.2 — no regressions across 157 metrics2026-07-20
- v2026.720.2vs v2026.720.1 — 1 regression across 157 metrics2026-07-20
- v2026.720.1vs v2026.718.2 — no regressions across 157 metrics2026-07-20
- v2026.718.2vs v2026.717.1 — no regressions across 157 metrics2026-07-20
- v2026.717.1vs v2026.715.1 — no regressions across 157 metrics2026-07-17
- v2026.715.1vs v2026.711.2 — 2 regressions across 157 metrics2026-07-15
- v2026.711.2vs v2026.711.1 — no regressions across 157 metrics2026-07-13
- v2026.711.1vs v2026.710.1 — no regressions across 157 metrics2026-07-11
- v2026.710.1vs v2026.709.2 — no regressions across 157 metrics2026-07-10
- v2026.709.2vs v2026.709.1 — no regressions across 157 metrics2026-07-10
- v2026.709.1vs v2026.708.3 — no regressions across 157 metrics2026-07-09
- v2026.708.3vs v2026.708.2 — no regressions across 157 metrics2026-07-08
- v2026.708.2vs v2026.708.1 — 2 regressions across 157 metrics2026-07-08
- v2026.708.1vs v2026.704.3 — no regressions across 157 metrics2026-07-08
- v2026.704.3vs v2026.704.1 — no regressions across 157 metrics2026-07-06
- v2026.703.7vs v2026.703.5 — no regressions across 157 metrics2026-07-03
- v2026.703.6vs v2026.703.3 — no regressions across 157 metrics2026-07-03
- v2026.703.3vs v2026.703.1 — 3 regressions across 157 metrics2026-07-03
See a real scan run
A replay of the actual CLI running against our test repositories — live progress, real findings, a genuine DriftScore. Nothing executes in your browser.