Reports

Evaluation reports.

Hands-on benchmarks from real agent-building work — model selection, persona quality, latency and cost. Data first, verdicts second.