# LLM routing and cost-quality measurement - **Status:** `complete` - **Outcome:** `partial` - **Started:** 2026-07-25 - **Updated:** 2026-07-25 - **Research ID:** `2026-07-25-llm-routing-cost-quality` ## Проверяемый вопрос Можно ли одним provider-agnostic harness сравнить full-context baseline и projection/delta/routing candidate, не подменяя model quality token reduction? ## Почему решение нужно сейчас Оптимизация без общего fixture/seed/metric contract создаёт несопоставимые и непроверяемые заявления об экономии. ## Scope - Fixed fixtures, seeds и fake adapter. - Declared routing separation по task type; adaptive risk routing не измеряется. - Full context против audience projection/state delta; cache-hit behavior не измеряется. - Rule/privacy/replay metrics, latency/usage telemetry и explicit `null` для fake-adapter metrics, которые не измерены. - Точный план real-provider benchmark без вызова API. ## Non-goals - Платные API-вызовы. - Выбор provider/model winner. - Денежная cost estimate без актуальной provider price evidence. ## Критерии успеха | ID | Обязательный критерий | Ожидаемое поведение | Способ проверки | |---|---|---|---| | AC-01 | Baseline/candidate используют одинаковые cases/seeds | manifest hashes совпадают | benchmark command | | AC-02 | Harness выдаёт обязательные metrics | Полный machine-readable report; unavailable values = `null`/Unknown | benchmark command | | AC-03 | Optimization не маскирует deterministic defects | Rule/privacy/replay metrics выводятся рядом с usage | benchmark tests | | AC-04 | Платный call невозможен | Только fake adapter; no provider credentials/config | source inspection | | AC-05 | Non-inferiority не выдумана | Real narration quality gate остаётся `not_measured` до утверждения threshold | report inspection | 2026-07-25: root `test:technical` позже расширили тестами независимых исследований. Для evidence сохранён точный central vertical-slice test glob; критерии и пороги не менялись. ## Рабочие гипотезы - **Hypothesis H-01:** audience projection и state delta уменьшат input payload proxy без изменения deterministic kernel metrics. ## Материалы - [Исследование и evidence log](RESEARCH.md) - [Техническое решение и запуск](SOLUTION.md) - [Проверка и итог](VALIDATION.md) - [`prototype/`](prototype/) ## Итог **Harness contract подтверждён, cost-quality вывод — нет.** Baseline и projection/delta candidate использовали один manifest hash `83cc1063…8f77`, 3 cases, одинаковые seeds и 20 repeats (60 observations на strategy). Fresh local fake-adapter run получил: - input bytes: `650060 → 136640`; - synthetic token proxy: `162515 → 34160`; - proxy reduction: `78.9804%`; - deterministic replay consistency `1`, invalid transition/leakage rates `0`; - real provider calls `0`, USD cost `null`, narration quality `not_measured`, non-inferiority `not_tested`. Это `partial`: измерена воспроизводимая локальная payload proxy, но не реальные tokens, price, provider latency или human-rated quality. Evidence: `E-004`–`E-012` в `RESEARCH.md`. Финальный `npm run check` прошёл; status `complete`, outcome остаётся `partial` из-за отсутствия real-model measurements. ## Ограничения Fake usage, in-process latency и fixture checks не доказывают quality/cost реальной модели. 78.9804% — reduction только выбранной byte-derived proxy. ## Следующее решение Сохранить harness как preflight. До real benchmark отдельно получить разрешение и pre-register exact provider/model IDs, current price source, rubric/non-inferiority margin, seeds, repeats, retries, budget и retention.