RnD · Линия доказательств Technical R&D
Каталог и оглавление
TECH.IDX RnD/technical/2026-07-25-llm-routing-cost-quality/README.md raw.md ->

LLM routing and cost-quality measurement

  • Status: complete
  • Outcome: partial
  • Started: 2026-07-25
  • Updated: 2026-07-25
  • Research ID: 2026-07-25-llm-routing-cost-quality

Проверяемый вопрос#

Можно ли одним provider-agnostic harness сравнить full-context baseline и projection/delta/routing candidate, не подменяя model quality token reduction?

Почему решение нужно сейчас#

Оптимизация без общего fixture/seed/metric contract создаёт несопоставимые и непроверяемые заявления об экономии.

Scope#

  • Fixed fixtures, seeds и fake adapter.
  • Declared routing separation по task type; adaptive risk routing не измеряется.
  • Full context против audience projection/state delta; cache-hit behavior не измеряется.
  • Rule/privacy/replay metrics, latency/usage telemetry и explicit null для fake-adapter metrics, которые не измерены.
  • Точный план real-provider benchmark без вызова API.

Non-goals#

  • Платные API-вызовы.
  • Выбор provider/model winner.
  • Денежная cost estimate без актуальной provider price evidence.

Критерии успеха#

ID Обязательный критерий Ожидаемое поведение Способ проверки
AC-01 Baseline/candidate используют одинаковые cases/seeds manifest hashes совпадают benchmark command
AC-02 Harness выдаёт обязательные metrics Полный machine-readable report; unavailable values = null/Unknown benchmark command
AC-03 Optimization не маскирует deterministic defects Rule/privacy/replay metrics выводятся рядом с usage benchmark tests
AC-04 Платный call невозможен Только fake adapter; no provider credentials/config source inspection
AC-05 Non-inferiority не выдумана Real narration quality gate остаётся not_measured до утверждения threshold report inspection

2026-07-25: root test:technical позже расширили тестами независимых исследований. Для evidence сохранён точный central vertical-slice test glob; критерии и пороги не менялись.

Рабочие гипотезы#

  • Hypothesis H-01: audience projection и state delta уменьшат input payload proxy без изменения deterministic kernel metrics.

Материалы#

Итог#

Harness contract подтверждён, cost-quality вывод — нет. Baseline и projection/delta candidate использовали один manifest hash 83cc1063…8f77, 3 cases, одинаковые seeds и 20 repeats (60 observations на strategy). Fresh local fake-adapter run получил:

  • input bytes: 650060 → 136640;
  • synthetic token proxy: 162515 → 34160;
  • proxy reduction: 78.9804%;
  • deterministic replay consistency 1, invalid transition/leakage rates 0;
  • real provider calls 0, USD cost null, narration quality not_measured, non-inferiority not_tested.

Это partial: измерена воспроизводимая локальная payload proxy, но не реальные tokens, price, provider latency или human-rated quality. Evidence: E-004E-012 в RESEARCH.md. Финальный npm run check прошёл; status complete, outcome остаётся partial из-за отсутствия real-model measurements.

Ограничения#

Fake usage, in-process latency и fixture checks не доказывают quality/cost реальной модели. 78.9804% — reduction только выбранной byte-derived proxy.

Следующее решение#

Сохранить harness как preflight. До real benchmark отдельно получить разрешение и pre-register exact provider/model IDs, current price source, rubric/non-inferiority margin, seeds, repeats, retries, budget и retention.