RnD · Линия доказательств Technical R&D
Каталог и оглавление
TECH.IDX RnD/technical/2026-07-26-strong-llm-core-escalation/README.md raw.md ->

Strong LLM core escalation

  • Status: complete
  • Outcome: fail
  • Started: 2026-07-26
  • Updated: 2026-07-26
  • Research ID: 2026-07-26-strong-llm-core-escalation

Проверяемый вопрос#

Может ли один из двух заранее зафиксированных сильных open-weight кандидатов сначала пройти bilingual screen для scenario drafting и post-commit narration, а затем на трёх held-out seeds пройти все три bounded core-роли без deterministic contract failure, противоречия canonical event, privacy leak или critical grounding failure?

Почему решение нужно сейчас#

Flash run-3 не дал bilingual winner: обе модели получили 4/6 по deterministic scorer, а независимый semantic audit дополнительно отклонил одну DeepSeek narration cell. Intent lane оказался сильным у обеих Flash-моделей, но scenario и narration требуют проверить более мощный routing tier до production-выбора provider.

Scope#

  • Exact Comfy-confirmed model IDs: deepseek/deepseek-v4-pro и mistralai/mistral-large-2512.
  • Open weights: MIT для DeepSeek V4 Pro и Apache 2.0 для Mistral Large 3.
  • Frozen Flash run-3 prompts, fixtures и deterministic TypeScript scorers.
  • Screening: 2 модели × ru/en × scenario/narration × seed 20260726: ровно 8 paid calls.
  • Conditional finalist confirmation: один выбранный model ID × ru/en × scenario/intent/narration × seeds 20260727, 20260728, 20260729: ровно 18 новых paid calls только при unique eligible screening winner.
  • Один call на workflow: OpenRouterLLMNode -> SaveText.
  • Raw response retention, SHA-256, deterministic scorer и independent agent semantic audit со скрытой explicit model metadata; это не криптографическая анонимность.
  • Reasoning disabled where the node supports it; для non-reasoning Mistral Large parameter отсутствует как not applicable.

Non-goals#

  • UI, voice, images, maps, music или другие media workflows.
  • Передача модели authority над rules, RNG, canonical state или event log.
  • Human naturalness review: independent agent audit не подменяет человека.
  • Production SLA, provider drift, long-campaign memory или load testing.
  • Доказательство качества в любом жанре или на любом языке.
  • Исправление frozen prompts/scorers после первого screening call.
  • Сравнение API-only Qwen Plus/Max или закрытых моделей.

Критерии успеха#

Критерии и выбор кандидатов фиксируются до первого paid screening call.

ID Обязательный критерий Порог или ожидаемое поведение Способ проверки
AC-01 Frozen protocol и catalog evidence Exact IDs присутствуют в live OpenRouterLLMNode; licenses подтверждены primary sources; prompts/scorers совпадают с Flash run-3 SHA; protocol/preflight hashes сохранены до calls catalog artifact, protocol artifact, TypeScript tests
AC-02 Полный screening Ровно 8 уникальных cells, 8 raw outputs и hashes; seed только 20260726; scenario/narration, ru/en prepared manifest, Comfy batch jobs, raw response index
AC-03 Предзарегистрированный selector Eligible только при deterministic 4/4, semantic score не ниже 1 во всех cells и 0 critical grounding failures; ranking: semantic-2 cells, затем semantic total, затем lower published Comfy price; никакого model-order tie-break selector tests, screening evidence и selection artifact
AC-04 Независимый finalist confirmation Только unique selected model; ровно 18 новых cells на held-out seeds 2026072720260729; screening outputs не переиспользуются finalist preflight, selection/evidence hashes, Comfy jobs
AC-05 Full-role capability gate 18/18 deterministic pass; все semantic scores не ниже 1; 0 critical grounding/privacy failures; intent, scenario и narration проходят в обоих языках на всех трёх seeds frozen scorers, explicit-model-metadata-hidden semantic audit, finalist scorecard
AC-06 Аудируемая provider boundary Raw outputs, prompt/workflow/model/seed binding, job IDs и retries сохранены; latency/tokens/credits записаны из доступной telemetry либо явно null/Unknown; секретов нет raw/derived artifacts и artifact audit
AC-07 Честный итог pass только при AC-01–AC-06; complete run с полезной, но неполной ролью — partial; полный screen без eligible model — fail; missing/ambiguous evidence — inconclusive VALIDATION.md и machine-readable verdict

Изменение criteria после первого paid call запрещено без датированной записи старого и нового значения. Historical artifacts не перезаписываются.

Рабочие гипотезы#

  • Hypothesis H-01: как минимум один сильный кандидат пройдёт 4/4 screening cells. Опровержение: обе модели не проходят хотя бы один deterministic или semantic hard gate. Результат: опровергнута. DeepSeek прошёл deterministic 4/4, но получил semantic 0 и critical grounding failure в RU scenario; Mistral не прошёл deterministic 0/4.
  • Hypothesis H-02: multilingual Mistral будет сильнее в narration, а DeepSeek Pro — в structurally constrained scenario. Опровержение: semantic/deterministic результаты из audit со скрытой explicit model metadata показывают обратное или равенство. Результат: опровергнута на этой fixture. Все четыре Mistral responses были обёрнуты в Markdown fences и непригодны как exact JSON; обе narration cells также получили critical grounding failure.
  • Hypothesis H-03: выбранный finalist сохранит intent 6/6 на held-out seeds, потому что intent уже был сильным Flash lane и authority остаётся в TypeScript. Опровержение: любой deterministic intent failure. Результат: не проверялась: selector не выбрал finalist, поэтому preregistered 18-call phase не запускалась.

Материалы#

Итог#

Screening завершён: Comfy подтвердил 8/8 ready jobs и 0 failures. DeepSeek получил deterministic 4/4, но independent audit в изолированном контексте со скрытой explicit model metadata поставил semantic scores 0, 1, 2, 1 и один critical grounding failure. Mistral получил deterministic 0/4 и semantic 0, 0, 0, 0: каждый raw response имел Markdown fence, а две narration cells содержали critical grounding failures.

Frozen selector воспроизводимо вернул no_eligible_candidate. Согласно предзарегистрированному gate finalist matrix не materialized и не запускалась: paid calls 8 screening + 0 finalist. Итог исследования — fail, а не произвольный выбор DeepSeek по лучшему относительному результату.

Ограничения#

Seed в OpenRouter является sampling hint и не гарантирует bit-for-bit воспроизводимость provider output. Один output на screening cell не доказывает production reliability или общую неспособность модели. Deterministic pass проверяет формальные contracts; independent agent audit проверяет grounding и coherence, но не human naturalness. Reviewer получил явно обезличенный временный пакет, однако разделял host filesystem и мог теоретически fingerprint-ить стиль. Provider token counts, per-job latency, retries и фактический credit delta текущий MCP не вернул, поэтому они зафиксированы как null/Unknown.

Следующее решение#

Не повышать tier вслепую и не ослаблять selector постфактум. Следующее исследование должно отдельно проверить prompt/contract instrument: усилить machine-output enforcement и добавить semantic invariant, который ловит противоречие immutable story facts до provider run. Только затем повторять model matrix под новым preregistered protocol; authoritative validation/RNG/commit остаются в TypeScript.