Benchmark
Status: Canonical
Owner: PL-006
Last updated: 2026-07-05
Dataset-driven evaluation of agent behavior — read-only with respect to production runtime.
Principles
| Rule | Detail |
|---|---|
| Isolation | Benchmark code paths do not mutate live orchestrator config |
| Reproducibility | Dataset version pinned in report |
| Regression | Every release compares against prior baseline |
Flow
mermaid
flowchart LR
DS[Ground truth dataset] --> RUN[Benchmark runner]
RUN --> RPT[Report JSON]
RPT --> ACC[Acceptance Lab]Related
Breadcrumbs: Home → AI → Benchmark