RnD · Линия доказательств Technical R&D
Каталог и оглавление
TECH.DOC RnD/technical/2026-07-26-strong-llm-core-escalation/VALIDATION.md raw.md ->

Validation: Strong LLM core escalation

Текущее состояние#

  • Study status: complete
  • Outcome: fail
  • Paid screening calls: 8
  • Paid finalist calls: 0
  • Comfy batch: 8 ready, 0 pending, 0 failed
  • Live MCP: production 0.32.0, OAuth authenticated after recorded recovery
  • Selected finalist: none

Outcome fail следует предзарегистрированному правилу: полный screen без eligible model завершает исследование и запрещает произвольный 18-call finalist run.

Criteria matrix#

Criterion Состояние Evidence
AC-01 pass exact live catalog IDs, primary license sources, frozen protocol/catalog/prompt/scorer hashes
AC-02 pass 8 unique requests, 8 ready jobs, 8 retained raw outputs, 0 missing
AC-03 pass bound evidence recomputes to no_eligible_candidate; no model-order fallback
AC-04 not satisfied selector не выбрал unique eligible model; finalist materialization корректно не разрешена
AC-05 not evaluated 18 held-out cells не запускаются после failed selector gate
AC-06 pass request/job/raw SHA binding сохранён; недоступные latency/token/retry/credit fields явно null/Unknown
AC-07 pass outcome = fail; incomplete capability не выдана за winner

Frozen protocol evidence#

Проверка Фактический результат
Protocol file SHA-256 80672c0cd2ab10f759a918f354ab4193272b21965d1500c3bd9048ad92d1bfbb
Escalation manifest hash a7feb83bd37433ad9ee109686035efd80c023f1413da8d16f9c0d6ea221e94f3
Semantic rubric hash 3d90905f2649ad52663775805cfd7152313d272306fbb38d9ee3f4cbd35cb3f3
Catalog options hash / count aa6ec51e7958356c88c214ac63f35ae7a44aa5dcb6bb6946bd94871b81ab73b3 / 33
Screening prepared manifest SHA-256 bf7088d0540bb1a7bf16b470a3df12abf0cb7a511b2e102a591a100be6bc6676
Frozen Flash evaluator SHA-256 22f2877444133b149624018cea155efac0749025eaf70343a1e2811dd4f9f425
Frozen Flash test SHA-256 ba9a43604e573ac6de19d327ea4b26e9d2fe2988238ec62e22f8db3cc40afcc6
Pre-paid test baseline npm run test:technical: 68/68; npm run typecheck: exit 0
Comfy dry-run 8/8 validated, 0 jobs, 0 credits
Post-run harness regression npm run test:technical: 90/90; npm run typecheck: exit 0
Final repository gate npm run check:all: 5/5 site, 90/90 technical, 2/2 Bun; technical/build/link validators: 0 failures

Первый dry-run до этой успешной preflight был отклонён до cloud validation ошибкой invalid_grant: refresh token reuse detected. Он создал 0 jobs и потратил 0 credits. После codex mcp login comfy-cloud официальный consent завершился успешно, get_server_info подтвердил production/OAuth, и 8/8 повторных dry-run прошли. Ошибка и recovery сохранены, а не удалены из истории.

Screening transport и raw evidence#

D/S/C ниже означает deterministic result / semantic score / critical grounding failure.

Model RU scenario RU narration EN scenario EN narration Eligible Rank
deepseek/deepseek-v4-pro PASS / 0 / yes PASS / 1 / no PASS / 2 / no PASS / 1 / no no [1, 4]
mistralai/mistral-large-2512 FAIL / 0 / no FAIL / 0 / yes FAIL / 0 / no FAIL / 0 / yes no [0, 0]

DeepSeek RU scenario прошёл structural scorer, но violated its own immutable story facts: successful path разрешал gravity behavior несовместимое с constant 1G/no G<1 facts и всё равно объявлял compliance. Это semantic 0 и critical grounding failure.

Mistral вернул все четыре ответы в Markdown fences, поэтому direct machine-consumable JSON contract провален 0/4. RU и EN narration также добавляли unsupported identities/logging aftermath.

Selector и finalist#

screening-evidence.json имеет semantic evidence hash 667d7b7b9bff762c11d59ffe7078430260888d8e99d91eb7b6ca31a5cb951e00. Повторный вызов frozen selectFinalist byte-for-byte совпадает с сохранённым artifact:

{
  "status": "no_eligible_candidate",
  "selectedModelId": null,
  "selectionBasis": null
}

Поэтому:

  • finalist preflight не создавался;
  • seeds 20260727-20260729 не запускались;
  • paid finalist calls = 0;
  • screening outputs не переиспользованы как held-out evidence.

Post-run trust-boundary verification#

Independent changes review обнаружил два harness gaps: preparation могла принять другой schema-valid catalog и перезаписать output, а selector мог получить hand-assembled evidence. Оба закрыты без изменения historical raw bytes или terminal decision:

  • preparation сверяет raw SHA/path catalog с frozen protocol-v1.json + protocol-v1-identity.json;
  • non-empty preparation output отклоняется до записи;
  • screening evidence выводится только из scorecard, semantic review и private map с exact alias/request/raw SHA/manifest/rubric binding;
  • evidence и selection, пересобранные реальными CLI-командами во временный каталог, byte-for-byte совпали с сохранёнными artifacts;
  • повторный prepare-screening в тот же каталог завершился ожидаемой ошибкой refusing to overwrite non-empty preparation output.

Telemetry и gaps#

screening-telemetry.json фиксирует observed batch wall interval 447000 ms; это interval между submission и collection, не per-job provider latency. Текущий MCP не вернул input/output tokens, per-job latency, retries или actual credit delta, поэтому эти поля сохранены как null/Unknown.

Также остаются Unknown:

  • human naturalness;
  • provider drift и seed determinism;
  • genre-diverse и long-session reliability;
  • Adventure/Map authoring -> runtime compiler interop.

Итоговый verdict#

На одной preregistered RU/EN sci-fi comedy fixture увеличение model tier не дало eligible core winner. Это опровергает H-01 и H-02 в границах данного screen, но не доказывает общую неспособность моделей. Следующий обоснованный шаг - новый protocol для улучшенного machine-output/semantic invariant instrument, а не ослабление текущих gates или post-hoc выбор DeepSeek.