# Strong LLM core escalation - **Status:** `complete` - **Outcome:** `fail` - **Started:** 2026-07-26 - **Updated:** 2026-07-26 - **Research ID:** `2026-07-26-strong-llm-core-escalation` ## Проверяемый вопрос Может ли один из двух заранее зафиксированных сильных open-weight кандидатов сначала пройти bilingual screen для scenario drafting и post-commit narration, а затем на трёх held-out seeds пройти все три bounded core-роли без deterministic contract failure, противоречия canonical event, privacy leak или critical grounding failure? ## Почему решение нужно сейчас Flash run-3 не дал bilingual winner: обе модели получили 4/6 по deterministic scorer, а независимый semantic audit дополнительно отклонил одну DeepSeek narration cell. Intent lane оказался сильным у обеих Flash-моделей, но scenario и narration требуют проверить более мощный routing tier до production-выбора provider. ## Scope - Exact Comfy-confirmed model IDs: `deepseek/deepseek-v4-pro` и `mistralai/mistral-large-2512`. - Open weights: MIT для DeepSeek V4 Pro и Apache 2.0 для Mistral Large 3. - Frozen Flash run-3 prompts, fixtures и deterministic TypeScript scorers. - Screening: 2 модели × `ru`/`en` × scenario/narration × seed `20260726`: ровно 8 paid calls. - Conditional finalist confirmation: один выбранный model ID × `ru`/`en` × scenario/intent/narration × seeds `20260727`, `20260728`, `20260729`: ровно 18 новых paid calls только при unique eligible screening winner. - Один call на workflow: `OpenRouterLLMNode -> SaveText`. - Raw response retention, SHA-256, deterministic scorer и independent agent semantic audit со скрытой explicit model metadata; это не криптографическая анонимность. - Reasoning disabled where the node supports it; для non-reasoning Mistral Large parameter отсутствует как not applicable. ## Non-goals - UI, voice, images, maps, music или другие media workflows. - Передача модели authority над rules, RNG, canonical state или event log. - Human naturalness review: independent agent audit не подменяет человека. - Production SLA, provider drift, long-campaign memory или load testing. - Доказательство качества в любом жанре или на любом языке. - Исправление frozen prompts/scorers после первого screening call. - Сравнение API-only Qwen Plus/Max или закрытых моделей. ## Критерии успеха Критерии и выбор кандидатов фиксируются до первого paid screening call. | ID | Обязательный критерий | Порог или ожидаемое поведение | Способ проверки | |---|---|---|---| | AC-01 | Frozen protocol и catalog evidence | Exact IDs присутствуют в live `OpenRouterLLMNode`; licenses подтверждены primary sources; prompts/scorers совпадают с Flash run-3 SHA; protocol/preflight hashes сохранены до calls | catalog artifact, protocol artifact, TypeScript tests | | AC-02 | Полный screening | Ровно 8 уникальных cells, 8 raw outputs и hashes; seed только `20260726`; scenario/narration, `ru`/`en` | prepared manifest, Comfy batch jobs, raw response index | | AC-03 | Предзарегистрированный selector | Eligible только при deterministic 4/4, semantic score не ниже 1 во всех cells и 0 critical grounding failures; ranking: semantic-2 cells, затем semantic total, затем lower published Comfy price; никакого model-order tie-break | selector tests, screening evidence и selection artifact | | AC-04 | Независимый finalist confirmation | Только unique selected model; ровно 18 новых cells на held-out seeds `20260727`–`20260729`; screening outputs не переиспользуются | finalist preflight, selection/evidence hashes, Comfy jobs | | AC-05 | Full-role capability gate | 18/18 deterministic pass; все semantic scores не ниже 1; 0 critical grounding/privacy failures; intent, scenario и narration проходят в обоих языках на всех трёх seeds | frozen scorers, explicit-model-metadata-hidden semantic audit, finalist scorecard | | AC-06 | Аудируемая provider boundary | Raw outputs, prompt/workflow/model/seed binding, job IDs и retries сохранены; latency/tokens/credits записаны из доступной telemetry либо явно `null`/Unknown; секретов нет | raw/derived artifacts и artifact audit | | AC-07 | Честный итог | `pass` только при AC-01–AC-06; complete run с полезной, но неполной ролью — `partial`; полный screen без eligible model — `fail`; missing/ambiguous evidence — `inconclusive` | `VALIDATION.md` и machine-readable verdict | Изменение criteria после первого paid call запрещено без датированной записи старого и нового значения. Historical artifacts не перезаписываются. ## Рабочие гипотезы - **Hypothesis H-01:** как минимум один сильный кандидат пройдёт 4/4 screening cells. Опровержение: обе модели не проходят хотя бы один deterministic или semantic hard gate. **Результат:** опровергнута. DeepSeek прошёл deterministic 4/4, но получил semantic 0 и critical grounding failure в RU scenario; Mistral не прошёл deterministic 0/4. - **Hypothesis H-02:** multilingual Mistral будет сильнее в narration, а DeepSeek Pro — в structurally constrained scenario. Опровержение: semantic/deterministic результаты из audit со скрытой explicit model metadata показывают обратное или равенство. **Результат:** опровергнута на этой fixture. Все четыре Mistral responses были обёрнуты в Markdown fences и непригодны как exact JSON; обе narration cells также получили critical grounding failure. - **Hypothesis H-03:** выбранный finalist сохранит intent 6/6 на held-out seeds, потому что intent уже был сильным Flash lane и authority остаётся в TypeScript. Опровержение: любой deterministic intent failure. **Результат:** не проверялась: selector не выбрал finalist, поэтому preregistered 18-call phase не запускалась. ## Материалы - [Исследование и evidence log](RESEARCH.md) - [Техническое решение и запуск](SOLUTION.md) - [Проверка и итог](VALIDATION.md) - [`prototype/`](prototype/) — manifest, workflow builder, frozen evaluator и selector - [`artifacts/`](artifacts/) — protocol, preflights, jobs, raw responses, reviews и scorecards ## Итог Screening завершён: Comfy подтвердил 8/8 ready jobs и 0 failures. DeepSeek получил deterministic 4/4, но independent audit в изолированном контексте со скрытой explicit model metadata поставил semantic scores `0, 1, 2, 1` и один critical grounding failure. Mistral получил deterministic 0/4 и semantic `0, 0, 0, 0`: каждый raw response имел Markdown fence, а две narration cells содержали critical grounding failures. Frozen selector воспроизводимо вернул `no_eligible_candidate`. Согласно предзарегистрированному gate finalist matrix не materialized и не запускалась: paid calls `8 screening + 0 finalist`. Итог исследования — `fail`, а не произвольный выбор DeepSeek по лучшему относительному результату. ## Ограничения Seed в OpenRouter является sampling hint и не гарантирует bit-for-bit воспроизводимость provider output. Один output на screening cell не доказывает production reliability или общую неспособность модели. Deterministic pass проверяет формальные contracts; independent agent audit проверяет grounding и coherence, но не human naturalness. Reviewer получил явно обезличенный временный пакет, однако разделял host filesystem и мог теоретически fingerprint-ить стиль. Provider token counts, per-job latency, retries и фактический credit delta текущий MCP не вернул, поэтому они зафиксированы как `null`/Unknown. ## Следующее решение Не повышать tier вслепую и не ослаблять selector постфактум. Следующее исследование должно отдельно проверить prompt/contract instrument: усилить machine-output enforcement и добавить semantic invariant, который ловит противоречие immutable story facts до provider run. Только затем повторять model matrix под новым preregistered protocol; authoritative validation/RNG/commit остаются в TypeScript.