# Solution: LLM routing and cost-quality measurement ## Выбранный подход Benchmark manifest фиксирует cases и seeds. Strategies меняют только context construction и declared routing. Adapter возвращает usage/latency/cost fields; fake adapter использует `synthetic_proxy`, а USD cost и real quality оставляет `null`/`not_measured`. Cache не симулируется: выдуманный hit rate был бы ложным evidence. ## Архитектура и поток данных `fixed manifest/seeds → strategy → serialized context → fake adapter → explicitly synthetic telemetry → deterministic evaluators → aggregate p50/p95/rates → machine-readable JSON` ## Структура прототипа - [`prototype/run.ts`](prototype/run.ts) — benchmark entry point. - Integrated harness и fixtures: [`../2026-07-25-ai-gm-vertical-slice/prototype/`](../2026-07-25-ai-gm-vertical-slice/prototype/). Wrapper утверждает manifest parity, complete metric shape, deterministic guardrails, zero provider calls и Unknown labeling перед печатью полного report. Domain/benchmark logic остаётся central. ## Требования Node.js 24.14.0; TypeScript 7.0.2; external services: none. ## Установка ```bash npm ci ``` ## Запуск ```bash node RnD/technical/2026-07-25-llm-routing-cost-quality/prototype/run.ts ``` Ожидается benchmark `1.0.0` JSON; process exit 0 только если все локальные AC выполнены. ## Тестирование ```bash node --test RnD/technical/2026-07-25-ai-gm-vertical-slice/prototype/tests/*.test.ts npm run test:technical npm run typecheck npm run technical:benchmark ``` ## Конфигурация Нет provider keys или price table. Real adapter добавляется только отдельным решением. ## Ограничения и безопасность Synthetic token proxy нельзя называть provider token count или monetary savings. p50/p95 измеряют локальную fake-output serialization на одной машине, не network/model latency. `narrativeContradictionRate`, `storyFactPreservation` и `retryRate` корректно равны `null`: fake adapter их не измеряет. Cache и adaptive risk routing также не измерены. ## Условия переноса в production Pre-register exact model IDs, prompt/schema versions, generation parameters, sample count/seeds, human quality rubric, non-inferiority margin, provider-reported usage/cache counters, current price evidence, retry policy, redaction/retention и budget cap.