Solution: Strong LLM core escalation
Архитектура измерения#
frozen Flash v3 prompt + exact model/language/role/seed
-> OpenRouterLLMNode
-> SaveText
-> retained raw bytes
-> frozen TypeScript role scorer
-> explicit-model-metadata-hidden semantic review
-> preregistered selector / full-role verdict
Модель остаётся untrusted proposal/narration component. Rules, RNG, commit, canonical state и audience projection не выполняются внутри LLM.
Runtime#
- Node.js/npm — основной executable path.
- Bun — compatibility gate, без второго lockfile.
- Comfy Cloud hosted MCP
0.32.0, production. OpenRouterLLMNodeиSaveText.- Секреты и account identifiers в artifacts не сохраняются.
Frozen inputs#
Новый harness импортирует buildRolePrompt и три scorer functions из
2026-07-26-flash-llm-core-evaluation, но не редактирует его manifest,
evaluator, tests или raw artifacts. Все шесть generated prompts проверяются
по preregistered SHA-256 до materialization workflows.
Generation policy:
- seed задаётся для каждой cell;
- DeepSeek:
model.reasoning_effort = "off"; - Mistral Large: parameter not applicable, потому что live node catalog классифицирует его как non-reasoning model;
- output token cap отсутствует в
OpenRouterLLMNodeи записан как Unknown control, а не выдуманный лимит.
Локальная подготовка screening#
Из корня репозитория:
npm run test:technical
npm run typecheck
node RnD/technical/2026-07-26-strong-llm-core-escalation/prototype/run.ts \
prepare-screening \
RnD/technical/2026-07-26-strong-llm-core-escalation/artifacts/derived/catalog-preflight.json \
RnD/technical/2026-07-26-strong-llm-core-escalation/artifacts/derived/screening-preflight
Команда materializes 8 API-format workflows и manifest только после
fail-closed проверки exact catalog evidence против
protocol-v1.json + protocol-v1-identity.json. Если output directory уже
не пуст, команда останавливается до записи и не перезаписывает исторический
run.
Provider execution#
- Каждый из 8 workflows проходит
submit_workflow(dry_run=true). - После 8/8 preflight pass отправляется один разрешённый
submit_batch. batch_idи все job IDs сохраняются до ожидания.wait_for_batchподтверждает8 ready / 0 pending / 0 failed.get_batch_outputвозвращает bounded batch download command.- Raw outputs сохраняются под request IDs; hashes и job binding записываются отдельно.
Batch — transport optimization, не один multi-node generation: каждый item содержит один model call и один output node.
Scoring и selector#
node RnD/technical/2026-07-26-strong-llm-core-escalation/prototype/run.ts \
score-screening \
RnD/technical/2026-07-26-strong-llm-core-escalation/artifacts/raw/screening \
RnD/technical/2026-07-26-strong-llm-core-escalation/artifacts/derived/screening-scorecard.json
Semantic review packet заменяет model IDs и request IDs независимыми
перемешанными cell-* aliases. Private map фиксирует alias, raw SHA, prompt,
language, role и seed до review; reviewer получает только временный packet.
Заявление ограничено explicit_model_metadata_hidden: это не
криптографическая анонимность и не human review.
После review unblind join проверяет exact alias coverage, raw SHA, language/role binding, manifest/rubric hashes и соединяет оценки с frozen deterministic scorecard. Selector принимает только этот bound evidence.
node RnD/technical/2026-07-26-strong-llm-core-escalation/prototype/run.ts \
build-screening-evidence \
--screening-scorecard SCORECARD \
--screening-semantic-review REVIEW \
--screening-private-map MAP \
--output EVIDENCE \
--assert-existing RECORDED_EVIDENCE
node RnD/technical/2026-07-26-strong-llm-core-escalation/prototype/run.ts \
select-finalist \
--screening-scorecard SCORECARD \
--screening-semantic-review REVIEW \
--screening-private-map MAP \
--evidence-output EVIDENCE \
--selection-output SELECTION \
--assert-existing-evidence RECORDED_EVIDENCE
--assert-existing и --assert-existing-evidence требуют byte-for-byte
совпадения пересобранного evidence с сохранённым artifact. Public TypeScript
API использует opaque verified evidence; JSON clone или type cast
отклоняются runtime-проверкой.
Подготовка finalist#
node RnD/technical/2026-07-26-strong-llm-core-escalation/prototype/run.ts \
prepare-finalist \
--selection SELECTION \
--screening-scorecard SCREENING_SCORECARD \
--screening-semantic-review SCREENING_REVIEW \
--screening-private-map SCREENING_MAP \
--assert-existing-evidence RECORDED_EVIDENCE \
--catalog-preflight CATALOG \
--output-root FINALIST_PREFLIGHT
Harness сначала заново строит verified screening evidence из трёх source artifacts, затем пересчитывает selection и связывает SHA. Подменённый winner, foreign manifest/rubric, alias/raw drift, missing review или неполная matrix отклоняются до записи finalist workflows.
Finalist execution повторяет тот же dry-run -> batch -> status -> output порядок для 18 новых cells.
После сохранения 18 raw responses итоговый scorer и blinded semantic packet запускаются отдельными именованными командами:
node RnD/technical/2026-07-26-strong-llm-core-escalation/prototype/run.ts \
score-finalist \
--selection SELECTION \
--screening-scorecard SCREENING_SCORECARD \
--screening-semantic-review SCREENING_REVIEW \
--screening-private-map SCREENING_MAP \
--assert-existing-evidence RECORDED_EVIDENCE \
--raw-root RAW \
--output SCORECARD
node RnD/technical/2026-07-26-strong-llm-core-escalation/prototype/run.ts \
prepare-finalist-review SCORECARD \
--raw-root RAW \
--review-packet-output REVIEW \
--mapping-output MAPPING
node RnD/technical/2026-07-26-strong-llm-core-escalation/prototype/run.ts \
score-finalist \
--selection SELECTION \
--screening-scorecard SCREENING_SCORECARD \
--screening-semantic-review SCREENING_REVIEW \
--screening-private-map SCREENING_MAP \
--assert-existing-evidence RECORDED_EVIDENCE \
--raw-root RAW \
--output REVIEWED_SCORECARD \
--semantic-evidence REVIEW \
--semantic-mapping MAPPING
Все uppercase values выше — явные caller-provided paths, а не предполагаемые имена файлов.
В фактическом run finalist-selection.json содержит
status: "no_eligible_candidate" и selectedModelId: null. Поэтому команда
prepare-finalist обязана fail closed, finalist-preflight/ не создаётся, а
paid finalist calls остаются равны нулю. Это ожидаемый terminal path
исследования, а не незавершённый запуск.
Фактические artifacts#
protocol-v1.jsonиprotocol-v1-identity.jsonфиксируют protocol SHA до paid calls.screening-jobs.jsonиscreening-outputs.jsonсвязывают request IDs, Comfy job IDs, source metadata и raw SHA.screening-telemetry.jsonхранит batch interval и явныеnull/Unknown для недоступных latency/token/retry/credit measurements.screening-scorecard.jsonсодержит frozen deterministic verdicts.semantic-audit-private-map.json,screening-semantic-review.jsonиscreening-evidence.jsonобразуют audit/unblind evidence chain.finalist-selection.jsonвоспроизводимо завершает selector без winner.artifact-audit.jsonфиксирует итог 40 cross-artifact consistency checks.