Strong LLM core escalation
- Status:
complete - Outcome:
fail - Started: 2026-07-26
- Updated: 2026-07-26
- Research ID:
2026-07-26-strong-llm-core-escalation
Проверяемый вопрос#
Может ли один из двух заранее зафиксированных сильных open-weight кандидатов сначала пройти bilingual screen для scenario drafting и post-commit narration, а затем на трёх held-out seeds пройти все три bounded core-роли без deterministic contract failure, противоречия canonical event, privacy leak или critical grounding failure?
Почему решение нужно сейчас#
Flash run-3 не дал bilingual winner: обе модели получили 4/6 по deterministic scorer, а независимый semantic audit дополнительно отклонил одну DeepSeek narration cell. Intent lane оказался сильным у обеих Flash-моделей, но scenario и narration требуют проверить более мощный routing tier до production-выбора provider.
Scope#
- Exact Comfy-confirmed model IDs:
deepseek/deepseek-v4-proиmistralai/mistral-large-2512. - Open weights: MIT для DeepSeek V4 Pro и Apache 2.0 для Mistral Large 3.
- Frozen Flash run-3 prompts, fixtures и deterministic TypeScript scorers.
- Screening: 2 модели ×
ru/en× scenario/narration × seed20260726: ровно 8 paid calls. - Conditional finalist confirmation: один выбранный model ID ×
ru/en× scenario/intent/narration × seeds20260727,20260728,20260729: ровно 18 новых paid calls только при unique eligible screening winner. - Один call на workflow:
OpenRouterLLMNode -> SaveText. - Raw response retention, SHA-256, deterministic scorer и independent agent semantic audit со скрытой explicit model metadata; это не криптографическая анонимность.
- Reasoning disabled where the node supports it; для non-reasoning Mistral Large parameter отсутствует как not applicable.
Non-goals#
- UI, voice, images, maps, music или другие media workflows.
- Передача модели authority над rules, RNG, canonical state или event log.
- Human naturalness review: independent agent audit не подменяет человека.
- Production SLA, provider drift, long-campaign memory или load testing.
- Доказательство качества в любом жанре или на любом языке.
- Исправление frozen prompts/scorers после первого screening call.
- Сравнение API-only Qwen Plus/Max или закрытых моделей.
Критерии успеха#
Критерии и выбор кандидатов фиксируются до первого paid screening call.
| ID | Обязательный критерий | Порог или ожидаемое поведение | Способ проверки |
|---|---|---|---|
| AC-01 | Frozen protocol и catalog evidence | Exact IDs присутствуют в live OpenRouterLLMNode; licenses подтверждены primary sources; prompts/scorers совпадают с Flash run-3 SHA; protocol/preflight hashes сохранены до calls |
catalog artifact, protocol artifact, TypeScript tests |
| AC-02 | Полный screening | Ровно 8 уникальных cells, 8 raw outputs и hashes; seed только 20260726; scenario/narration, ru/en |
prepared manifest, Comfy batch jobs, raw response index |
| AC-03 | Предзарегистрированный selector | Eligible только при deterministic 4/4, semantic score не ниже 1 во всех cells и 0 critical grounding failures; ranking: semantic-2 cells, затем semantic total, затем lower published Comfy price; никакого model-order tie-break | selector tests, screening evidence и selection artifact |
| AC-04 | Независимый finalist confirmation | Только unique selected model; ровно 18 новых cells на held-out seeds 20260727–20260729; screening outputs не переиспользуются |
finalist preflight, selection/evidence hashes, Comfy jobs |
| AC-05 | Full-role capability gate | 18/18 deterministic pass; все semantic scores не ниже 1; 0 critical grounding/privacy failures; intent, scenario и narration проходят в обоих языках на всех трёх seeds | frozen scorers, explicit-model-metadata-hidden semantic audit, finalist scorecard |
| AC-06 | Аудируемая provider boundary | Raw outputs, prompt/workflow/model/seed binding, job IDs и retries сохранены; latency/tokens/credits записаны из доступной telemetry либо явно null/Unknown; секретов нет |
raw/derived artifacts и artifact audit |
| AC-07 | Честный итог | pass только при AC-01–AC-06; complete run с полезной, но неполной ролью — partial; полный screen без eligible model — fail; missing/ambiguous evidence — inconclusive |
VALIDATION.md и machine-readable verdict |
Изменение criteria после первого paid call запрещено без датированной записи старого и нового значения. Historical artifacts не перезаписываются.
Рабочие гипотезы#
- Hypothesis H-01: как минимум один сильный кандидат пройдёт 4/4 screening cells. Опровержение: обе модели не проходят хотя бы один deterministic или semantic hard gate. Результат: опровергнута. DeepSeek прошёл deterministic 4/4, но получил semantic 0 и critical grounding failure в RU scenario; Mistral не прошёл deterministic 0/4.
- Hypothesis H-02: multilingual Mistral будет сильнее в narration, а DeepSeek Pro — в structurally constrained scenario. Опровержение: semantic/deterministic результаты из audit со скрытой explicit model metadata показывают обратное или равенство. Результат: опровергнута на этой fixture. Все четыре Mistral responses были обёрнуты в Markdown fences и непригодны как exact JSON; обе narration cells также получили critical grounding failure.
- Hypothesis H-03: выбранный finalist сохранит intent 6/6 на held-out seeds, потому что intent уже был сильным Flash lane и authority остаётся в TypeScript. Опровержение: любой deterministic intent failure. Результат: не проверялась: selector не выбрал finalist, поэтому preregistered 18-call phase не запускалась.
Материалы#
- Исследование и evidence log
- Техническое решение и запуск
- Проверка и итог
prototype/— manifest, workflow builder, frozen evaluator и selectorartifacts/— protocol, preflights, jobs, raw responses, reviews и scorecards
Итог#
Screening завершён: Comfy подтвердил 8/8 ready jobs и 0 failures. DeepSeek
получил deterministic 4/4, но independent audit в изолированном контексте со
скрытой explicit model metadata поставил semantic scores 0, 1, 2, 1 и один
critical grounding failure. Mistral получил deterministic 0/4 и semantic
0, 0, 0, 0: каждый raw response имел Markdown fence, а две narration cells
содержали critical grounding failures.
Frozen selector воспроизводимо вернул no_eligible_candidate. Согласно
предзарегистрированному gate finalist matrix не materialized и не запускалась:
paid calls 8 screening + 0 finalist. Итог исследования — fail, а не
произвольный выбор DeepSeek по лучшему относительному результату.
Ограничения#
Seed в OpenRouter является sampling hint и не гарантирует bit-for-bit
воспроизводимость provider output. Один output на screening cell не
доказывает production reliability или общую неспособность модели.
Deterministic pass проверяет формальные contracts; independent agent audit
проверяет grounding и coherence, но не human naturalness. Reviewer получил
явно обезличенный временный пакет, однако разделял host filesystem и мог
теоретически fingerprint-ить стиль. Provider token counts, per-job latency,
retries и фактический credit delta текущий MCP не вернул, поэтому они
зафиксированы как null/Unknown.
Следующее решение#
Не повышать tier вслепую и не ослаблять selector постфактум. Следующее исследование должно отдельно проверить prompt/contract instrument: усилить machine-output enforcement и добавить semantic invariant, который ловит противоречие immutable story facts до provider run. Только затем повторять model matrix под новым preregistered protocol; authoritative validation/RNG/commit остаются в TypeScript.