LLM routing and cost-quality measurement
- Status:
complete - Outcome:
partial - Started: 2026-07-25
- Updated: 2026-07-25
- Research ID:
2026-07-25-llm-routing-cost-quality
Проверяемый вопрос#
Можно ли одним provider-agnostic harness сравнить full-context baseline и projection/delta/routing candidate, не подменяя model quality token reduction?
Почему решение нужно сейчас#
Оптимизация без общего fixture/seed/metric contract создаёт несопоставимые и непроверяемые заявления об экономии.
Scope#
- Fixed fixtures, seeds и fake adapter.
- Declared routing separation по task type; adaptive risk routing не измеряется.
- Full context против audience projection/state delta; cache-hit behavior не измеряется.
- Rule/privacy/replay metrics, latency/usage telemetry и explicit
nullдля fake-adapter metrics, которые не измерены. - Точный план real-provider benchmark без вызова API.
Non-goals#
- Платные API-вызовы.
- Выбор provider/model winner.
- Денежная cost estimate без актуальной provider price evidence.
Критерии успеха#
| ID | Обязательный критерий | Ожидаемое поведение | Способ проверки |
|---|---|---|---|
| AC-01 | Baseline/candidate используют одинаковые cases/seeds | manifest hashes совпадают | benchmark command |
| AC-02 | Harness выдаёт обязательные metrics | Полный machine-readable report; unavailable values = null/Unknown |
benchmark command |
| AC-03 | Optimization не маскирует deterministic defects | Rule/privacy/replay metrics выводятся рядом с usage | benchmark tests |
| AC-04 | Платный call невозможен | Только fake adapter; no provider credentials/config | source inspection |
| AC-05 | Non-inferiority не выдумана | Real narration quality gate остаётся not_measured до утверждения threshold |
report inspection |
2026-07-25: root test:technical позже расширили тестами независимых
исследований. Для evidence сохранён точный central vertical-slice test glob;
критерии и пороги не менялись.
Рабочие гипотезы#
- Hypothesis H-01: audience projection и state delta уменьшат input payload proxy без изменения deterministic kernel metrics.
Материалы#
Итог#
Harness contract подтверждён, cost-quality вывод — нет. Baseline и
projection/delta candidate использовали один manifest hash
83cc1063…8f77, 3 cases, одинаковые seeds и 20 repeats (60 observations на
strategy). Fresh local fake-adapter run получил:
- input bytes:
650060 → 136640; - synthetic token proxy:
162515 → 34160; - proxy reduction:
78.9804%; - deterministic replay consistency
1, invalid transition/leakage rates0; - real provider calls
0, USD costnull, narration qualitynot_measured, non-inferioritynot_tested.
Это partial: измерена воспроизводимая локальная payload proxy, но не реальные
tokens, price, provider latency или human-rated quality. Evidence:
E-004–E-012 в RESEARCH.md.
Финальный npm run check прошёл; status complete, outcome остаётся partial
из-за отсутствия real-model measurements.
Ограничения#
Fake usage, in-process latency и fixture checks не доказывают quality/cost реальной модели. 78.9804% — reduction только выбранной byte-derived proxy.
Следующее решение#
Сохранить harness как preflight. До real benchmark отдельно получить разрешение и pre-register exact provider/model IDs, current price source, rubric/non-inferiority margin, seeds, repeats, retries, budget и retention.