RnD · Линия доказательств Technical R&D
Каталог и оглавление
TECH.DOC RnD/technical/2026-07-26-flash-llm-core-evaluation/RESEARCH.md raw.md ->

Research: Flash LLM core evaluation

Baseline#

Existing vertical slice доказывает порядок intent -> validate -> authoritative rules/RNG -> commit -> projection -> narration на fake adapters. Existing cost-quality study использует fake_local, не делает provider calls и оставляет real quality, latency, tokens, retries и cost как Unknown.

Authoring HostPreferences/AdventureDraft и runtime HostPreferences/AdventureContract несовместимы и пока не связаны compiler mapping. Поэтому три роли сравниваются отдельно.

Метод#

Фиксированная матрица#

models    = qwen/qwen3.6-flash, deepseek/deepseek-v4-flash
languages = ru, en
roles     = scenario, intent, narration
repeats   = 1
seed      = 20260726
calls     = 2 × 2 × 3 × 1 = 12

Предрегистрация требовала отдельный последовательный Comfy job для каждого call. Один workflow содержит только OpenRouterLLMNode -> SaveText. Reasoning выключен. Comfy сохраняет сырой ответ; локальный TypeScript один раз парсит JSON и выполняет schema, semantic, rules, state, continuity, privacy и language checks. Фактическое отклонение run-1 от последовательного запуска зафиксировано ниже и не скрывается.

Scenario#

Модель получает один original sci-fi comedy HostPreferences fixture, targetLanguage и компактный structural contract. Выход — только AdventureDraft. После safe unknown boundary выполняются:

  1. shape/schema validation;
  2. validateAdventureDraft;
  3. sourceAdventureId === preferences.adventureId;
  4. compileAdventureContract;
  5. validateAdventureContract;
  6. forbidden sentinel и language checks.

Intent#

Один call возвращает outputs для четырёх case IDs:

  1. valid insight check;
  2. syntactically valid, но unreachable move;
  3. ambiguous action;
  4. rules/secrets/roll injection.

Proposal проходит существующие parseCommandProposal и executeProposal. Clarification/illegal cases проверяются на отсутствие event/state mutation. Любой roll допустим только с source: "server".

Narration#

Один call получает две NarrationRequest: successful и failed committed check. Модель видит только audience projection и committed event. Scorer проверяет outcome, total, difficulty, effects, forbidden hidden fixture facts, language signal и неизменность state hash.

Языковая rubric#

Для каждой из четырёх narration cells после deterministic language-signal check фиксируется одна ручная оценка:

Score Определение
0 Неверный язык, бессвязный или непригодный текст
1 Смысл понятен, но заметны смешение языков, неестественность или потеря тона
2 Свободный, естественный, пригодный для игры текст с требуемым playful bureaucratic tone

Оценка 2 нужна для утверждения «language quality passed». Оценка не выводится автоматически и не подменяет raw evidence.

Контроль стоимости#

Comfy не предоставляет hard per-run output token cap для OpenRouterLLMNode. Preregistered soft control требовал sequential jobs, reasoning_effort=off, balance до старта и после каждого job, прекращение после превышения согласованной credit delta. Явное согласие на расход было получено, однако live billing status в доступном MCP toolset отсутствовал.

В run-3 параллельный OAuth dry-run столкнулся с refresh-token race; dry-run повторили строго последовательно и получили 12/12 valid graphs. Paid execution затем был одним submit_batch на 12 jobs, а не per-job последовательностью с billing checks. Credit delta восстановить нельзя, поэтому AC-07 не считается доказанным.

Наблюдение run-1#

  • Наблюдались 12/12 preregistered ячеек: 11 jobs вернули raw provider output, для Qwen RU intent сохранён пустой raw artifact с явной ошибкой.
  • Первый Qwen RU intent prompt_id не зарегистрировался; подтверждённый retry завершился job.empty_output.
  • Telemetry по latency, tokens и credits остаётся Unknown для 12/12 ячеек.
  • После исправления false-negative narration matcher deterministic результаты: Qwen 3/6, DeepSeek 2/6, narration 4/4 overall.
  • Scenario и intent результаты нельзя интерпретировать как чистое сравнение моделей: их prompts оказались недостаточно точными относительно scorer contracts. Human narration naturalness и billing audit не выполнены.

Историческое наблюдение correction run-2#

  • До paid calls сохранён correction protocol. Полный SHA-256 preflight-v2/manifest.json: 6342c3f46b145de75b947cb55289c339ac441fe8a1cf7a1bf54d7ca29c361c32.
  • Dry-run проверил 8/8 исправленных scenario+intent workflows, 0 failed и 0 credits. После явного согласия correction batch завершил 8/8 jobs, failed at submission = 0.
  • Четыре narration raw files переиспользованы из run-1. Pairwise SHA-256 совпадают byte-for-byte; provider rerun для них не выполнялся.
  • Scorecard наблюдает 12/12 artifacts, missing 0 и telemetry Unknown 12/12. Manual review отсутствует: 0/4 narration cells. Billing audit отсутствует.
  • DeepSeek проходит 6/6 deterministic cells: scenario 2/2, intent 2/2, narration 2/2; deterministicCorePassed=true.
  • Qwen проходит 4/6: intent 2/2 и narration 2/2, scenario 0/2. RU scenario нарушил visibility schema в storyFacts/1; EN scenario вернул нестроковый clocks/0/whenFull.

Позднейший independent audit выявил answer leakage в intent case IDs и deterministic-scorer false positives. Поэтому run-2 numbers остаются историческими для evaluator revision 2 и не поддерживают текущий вывод о кандидате.

Текущее наблюдение run-3#

  • Protocol revision 3 зафиксирован до provider calls: logical manifest a758d221a63eb2f2600af570d8431764597bd8c3ae75d4960d94d8963e0ebfb8, полный preflight-v3 manifest SHA 9780519911a6c7fc2ed3d6efacf292899a321d8156c0c36ec71ff3c553c2d8f3.
  • Все 12 role prompts/public contracts изменились, поэтому выполнены 12 новых paid jobs без reuse run-1/run-2 outputs. Job log: ready 12, pending 0, failed 0.
  • Все 12 raw responses — valid JSON с сохранёнными SHA-256. Telemetry Unknown 12/12; manual naturalness review missing 0/4; billing audit missing.
  • На момент evaluator audit initial scorecard хранился только как SHA-256 и diagnostic summary. После changes review полная byte-exact версия восстановлена в artifacts/derived/run-3-scorecard-pre-amendment.json; SHA-256 08236755…bbf2665 совпадает с первоначально записанным hash. Это проверяемая реконструкция, а не original write-once snapshot. Raw files заморожены и остались byte-identical; provider rerun не выполнялся.
  • После behavior-level RED 18 pass / 2 expected fail и GREEN 20/20 canonical scorecard пересоздан. Deterministic totals: Qwen 4/6 и DeepSeek 4/6; оба scenario 1/2, intent 2/2, narration 1/2.
  • Independent agent semantic audit — не human review — даёт Qwen 4/6 и DeepSeek 3/6. DeepSeek RU narration дополнительно fail strict grounding: «Юноша (Juno)» выдумывает отсутствующие в projection возраст и гендер.
  • Scenario pass structural only: executable free-text predicates и coherence не измерены. Privacy check измеряет exact hidden-token matches, но не translated/paraphrased leakage.

Реестр доказательств#

ID Тип Описание Источник, путь или команда Дата или версия
E-001 Fact Existing real-model metrics отсутствуют: fake adapter, 0 calls, quality/cost Unknown ../2026-07-25-llm-routing-cost-quality/README.md 2026-07-25
E-002 Fact Runtime порядок commit-before-narration и projection boundary уже реализованы ../2026-07-25-ai-gm-vertical-slice/prototype/src/orchestrator.ts working tree, 2026-07-26
E-003 Fact Rich Adventure draft имеет semantic validators/compiler, но safe unknown boundary отсутствовал ../2026-07-25-adventure-contract-generation/prototype/adventure.ts working tree, 2026-07-26
E-004 Fact Qwen3.6-Flash связан с open-weight Qwen3.6-35B-A3B, Apache-2.0 https://github.com/QwenLM/Qwen3.6#license-agreement accessed 2026-07-26
E-005 Fact DeepSeek-V4-Flash публикуется как open-weight checkpoint под MIT https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash accessed 2026-07-26
E-006 Fact Official Comfy MCP exposes billing status and requires consent for paid generation https://docs.comfy.org/agent-tools/mcp accessed 2026-07-26
E-007 Fact Current Partner Node prices: Qwen 56.57/339.45 and DeepSeek 33.79/67.59 credits per 1M input/output tokens https://docs.comfy.org/tutorials/partner-nodes/pricing accessed 2026-07-26
E-008 Unknown Live balance, actual prompt/output tokens, credit delta и latency artifacts/raw/run-1/telemetry.json; live billing method unavailable pending
E-009 Measurement Preflight создал 12 requests, 6 unique prompt hashes, 12 unique workflow hashes; manifest 310f4e6e184d6e0f1b18bdfa373690c9c8788230e06ec3647777ed9f352620c1 node prototype/run.ts prepare; artifacts/derived/preflight-v1/manifest.json 2026-07-26T03:47+07:00
E-010 Measurement Новый behavioral suite: 7/7 pass; strict TypeScript exit 0 node --test prototype/run.test.ts; npm run typecheck Node 24.14.0; TypeScript 7.0.2
E-011 Measurement Два read-only Codex billing probes не инициализировали MCP: HTTP 400 handshake, затем timeout awaiting tools/list after 30s; на момент probes paid calls ещё не было ephemeral codex exec; local terminal evidence Codex CLI 0.145.0; 2026-07-26T03:48–03:51+07:00
E-012 Fact Qwen/DeepSeek expose reasoning effort; search_context_size относится к Perplexity Sonar и исключён из workflow https://docs.comfy.org/tutorials/partner-nodes/openrouter/llm accessed 2026-07-26
E-013 Measurement Полный локальный gate прошёл: site 4/4, technical 48/48, strict typecheck, 11 studies, build 101 docs, validation 259 HTML pages/27 837 links/3 462 anchors/55 presentation links/0 failures, Bun 2/2 npm run check:all 2026-07-26
E-014 Measurement Живая библиотека открылась; после клика по Flash LLM core evaluation показала README, затем после клика по evidence-log — RESEARCH; browser console errors/warnings = 0 isolated playwright-cli session against http://127.0.0.1:8788 2026-07-26T04:02+07:00
E-015 Measurement Design detector отработал на двух построенных HTML: обязательных блокеров нет; отмечены advisory generated-shell color/number markers и warning о пяти em dashes impeccable detect --json dist/.../README.html dist/.../RESEARCH.html 2026-07-26T04:03+07:00
E-016 Measurement Review выявил premature pass: scorecard не требовал human naturalness и billing audit. RED test воспроизвёл pass; v2 gate теперь оставляет результат inconclusive без обоих artifacts и разрешает pass только с complete valid evidence prototype/run.test.ts; prototype/run.ts; targeted suite 8/8 2026-07-26
E-017 Measurement Повторный OAuth login завершился успешно, но свежий read-only Codex probe снова не зарегистрировал Comfy tools: TypeError: tools.mcp__comfy_cloud__get_billing_status is not a function; shutdown сообщил failed initialize после HTTP 400 codex mcp login comfy-cloud; ephemeral codex exec Codex CLI 0.145.0; 2026-07-26T04:07–04:08+07:00
E-018 Measurement Финальный после review полный gate прошёл: site 4/4, technical 49/49, strict typecheck, 11 studies, build 101 docs, validation 259 HTML pages/27 838 links/3 462 anchors/55 presentation links/0 failures, Bun 2/2 npm run check:all 2026-07-26
E-019 Measurement Pre-run scorecard snapshot: 0/12 raw, manual review missing, billing audit missing, outcome inconclusive; provider calls на тот момент ещё не выполнялись node prototype/run.ts evaluate; historical local output 2026-07-26T04:17+07:00
E-020 Measurement Follow-up review выявил stale evidence reuse. Проверка logical manifestHash отклоняла unrelated manifests, но позднее v1/v2 показали, что этого недостаточно, если hash не включает protocol/prompt identity prototype/run.test.ts; prototype/run.ts; historical v2 limitation 2026-07-26
E-021 Measurement Run-1 наблюдал 12/12 ячеек и сохранил 11 raw provider outputs; Qwen RU intent: первый job не зарегистрирован, подтверждённый retry завершился job.empty_output artifacts/derived/run-1-jobs.json; artifacts/raw/run-1/responses/ 2026-07-26
E-022 Measurement Исправленный deterministic scorecard: Qwen 3/6, DeepSeek 2/6, narration 4/4; telemetry Unknown 12/12; manual review и billing audit missing; outcome inconclusive node prototype/run.ts evaluate; artifacts/derived/run-1-scorecard.json; artifacts/raw/run-1/telemetry.json 2026-07-26
E-023 Measurement Audit выявил under-specified intent CommandProposal, scenario array/null requirements и RU narration false negatives из-за JavaScript \w/verb coverage; исправления воспроизведены RED tests и проходят targeted suite prototype/prompts/intent.txt; prototype/prompts/scenario.txt; prototype/evaluation.ts; prototype/run.test.ts 2026-07-26
E-024 Decision До новых paid calls зарегистрирован correction protocol: отдельный preflight-v2, rerun только 8 scenario+intent cells, reuse 4 неизменённых narration outputs без provider rerun; v1 history не перезаписывается README.md, раздел Protocol amendment; этот журнал 2026-07-26
E-025 Unknown Generation через официальный MCP стала доступна, но live billing status и фактический credit delta run-1 получить нельзя exposed Comfy MCP toolset; artifacts/raw/run-1/telemetry.json 2026-07-26
E-026 Measurement Correction protocol сохранил v1 history, определил 8 provider reruns + 4 narration reuses и идентифицировал correction bundle полным preflight-v2 manifest SHA 6342c3f4…61c32; dry-run 8/8, 0 failed, 0 credits artifacts/derived/run-2-protocol.json; artifacts/derived/preflight-v2/manifest.json 2026-07-26T13:49:57+07:00
E-027 Measurement Разрешённый correction batch отправил 8/8 workflows; все 8 jobs завершились, failed at submission = 0; prompt IDs и output URLs сохранены artifacts/derived/run-2-jobs.json submitted 2026-07-26T13:51:59+07:00
E-028 Measurement Четыре narration files в run-2 byte-identical соответствующим run-1 files; pairwise SHA-256 совпали, provider rerun не выполнялся shasum -a 256 artifacts/raw/run-{1,2}/responses/*narration*.json; artifacts/derived/run-2-protocol.json 2026-07-26
E-029 Historical measurement Run-2 scorecard under evaluator revision 2: observed 12/12, DeepSeek 6/6, Qwen 4/6. Позднейший audit обнаружил answer leakage/false positives, поэтому это не current model-selection evidence artifacts/derived/run-2-scorecard.json; superseded by artifacts/derived/run-3-protocol.json generated 2026-07-26T06:59:43.919Z
E-030 Historical unknown Run-2 human naturalness 0/4 и billing audit missing; strict outcome был inconclusive даже до обнаружения measurement defects artifacts/derived/run-2-scorecard.json 2026-07-26
E-031 Decision Run-3 protocol revision 3 сохранил prior runs, запретил rescore/reuse, убрал answer-bearing intent IDs и усилил scenario/narration instrument; logical manifest a758d221…0ebfb8, full preflight SHA 97805199…2d8f3 artifacts/derived/run-3-protocol.json; artifacts/derived/preflight-v3/manifest.json 2026-07-26T14:21:46+07:00
E-032 Operational measurement Параллельный OAuth dry-run столкнулся с refresh-token race; повторная проверка выполнялась последовательно и завершила 12/12 graphs, 0 failed, 0 credits. Paid run позднее отправлен одним batch, не per-job run-3 execution observation; artifacts/derived/run-3-protocol.json dry-run complete 2026-07-26T14:29:29+07:00
E-033 Measurement Один разрешённый run-3 batch отправил 12 paid jobs; final summary ready 12, pending 0, failed 0; prompt IDs и output URLs сохранены artifacts/derived/run-3-jobs.json 2026-07-26T14:29:58–14:36:59+07:00
E-034 Measurement Run-3 содержит 12/12 valid JSON raw responses с SHA-256; missing 0; telemetry Unknown 12/12, retryCount 0/error null; manual review 0/4 и billing audit missing artifacts/raw/run-3/; artifacts/raw/run-3/telemetry.json; artifacts/derived/run-3-scorecard.json 2026-07-26
E-035 Measurement Evaluator audit зафиксировал initial scorecard hash, заморозил 12 raw hashes и запретил provider rerun; RED 18/2 expected failures, GREEN 20/0; canonical scorecard пересоздан: Qwen 4/6, DeepSeek 4/6 artifacts/derived/run-3-evaluator-audit.json; artifacts/derived/run-3-scorecard.json recorded 2026-07-26T14:41:17+07:00
E-036 Agent semantic audit Independent agent audit, не human naturalness review: Qwen 4/6, DeepSeek 3/6; DeepSeek RU narration fail strict grounding из-за ungrounded «Юноша (Juno)» artifacts/derived/run-3-evaluator-audit.jsonindependentReview 2026-07-26
E-037 Measurement limit Scenario gate structural only; executable exit predicates, story coherence/host fit не измерены. Privacy exact-token measured, paraphrase leakage not measured; human naturalness missing, billing delta Unknown artifacts/derived/run-3-protocol.json; artifacts/derived/run-3-evaluator-audit.json 2026-07-26
E-038 Recovered measurement artifact Полный pre-amendment scorecard восстановлен byte-exact после review; его SHA-256 08236755…bbf2665 совпадает с hash, записанным до regeneration canonical path. Это reconstruction, не original write-once snapshot artifacts/derived/run-3-scorecard-pre-amendment.json; artifacts/derived/run-3-evaluator-audit.json recovered 2026-07-26T15:08:28+07:00
E-039 Measurement Fresh repository gate после artifact/doc sync: site 5/5, technical 61/61, strict typecheck, 11 studies, build 101 docs, validation 272 HTML pages/28 099 local links/3 493 anchors/55 presentation links/0 failures, Bun 2/2 npm run check:all 2026-07-26T15:10+07:00
E-040 Browser measurement Isolated Playwright desktop flow: library → README → RESEARCH; console 0 errors/warnings. На 390×844 RESEARCH и README имеют document.scrollWidth=390; таблица сохраняет внутренний auto-scroll 356/672; mobile previous-document click работает playwright-cli; http://127.0.0.1:8788 2026-07-26T15:10–15:12+07:00
E-041 Advisory design check Bounded scan двух built HTML завершён; detector сообщил только advisory/warning для generated shell, document prose и порядковых evidence codes, без verification blocker impeccable detect --json dist/.../README.html dist/.../RESEARCH.html 2026-07-26T15:12+07:00

Журнал экспериментов#

Время Изменение или попытка Наблюдение Artifact или evidence ID Вывод
2026-07-26T03:15:00+07:00 Предрегистрация вопроса и матрицы до model calls Зафиксированы 12 calls, seed, roles, languages, assertions и pass rule README.md, E-001E-007 Можно строить локальный harness без расхода credits
2026-07-26T03:47:00+07:00 Local prepare + TDD verification 12 single-call workflows; manifest 310f4e6e…620c1; 7/7 tests; typecheck clean E-009, E-010 Локальный evaluator готов, generation не выполнялась
2026-07-26T03:48:00+07:00 Free get_billing_status probe MCP initialization failed twice before billing tool became callable E-011 На этом этапе live balance и paid execution были blocked; calls ещё не выполнялись
2026-07-26 Первый полный check:all Build обнаружил unresolved double-brace placeholders в трёх prompt templates с расширением .md local command output Ошибка была в выборе renderable extension, а не в model harness
2026-07-26 Prompt templates переименованы .md -> .txt, полный gate повторён Все локальные проверки прошли, включая 48 technical tests и validation построенного сайта E-013 Неуспешная попытка сохранена в журнале; исправление подтверждено полным прогоном
2026-07-26T04:02:00+07:00 Browser E2E и advisory design scan Два последовательных клика открыли README и RESEARCH нового исследования; browser console чист; detector не нашёл blocking issue E-014, E-015 Документ доступен пользователю в живой библиотеке
2026-07-26 Changes review и outcome-gate regression RED показал, что 12 deterministic passes давали преждевременный pass; после v2 gate отсутствие manual/billing evidence даёт inconclusive, а complete audit допускает pass E-016 Final claim теперь соответствует preregistered AC-06 и AC-07
2026-07-26T04:07:00+07:00 Повторная OAuth-авторизация и free billing probe OAuth success; Streamable HTTP tools всё равно не прошли initialize/list, billing method отсутствует в fresh child E-017 На этом этапе paid calls ещё не выполнялись
2026-07-26T04:17:00+07:00 Финальный local gate и pre-run v2 evaluate 49/49 technical tests, весь repository gate clean; scorecard snapshot фиксировал 12 missing raw и inconclusive E-018, E-019 Preflight завершён; это историческое состояние до provider run
2026-07-26 Follow-up review: stale evidence binding RED подтвердил, что foreign manifest принимался при тех же request IDs; оба audit artifacts теперь проверяются против текущего manifest hash E-020 Старые manual/billing файлы не могут подтвердить новый run
2026-07-26 (run-1) Первый paid call и подтверждённый batch оставшихся 11 cells 11 provider outputs сохранены; один Qwen RU intent prompt ID не зарегистрирован E-021; artifacts/derived/run-1-jobs.json Real-model evidence получен, но run содержит provider failure
2026-07-26 (run-1 retry) Подтверждённый retry Qwen RU intent Job завершился без output; job.empty_output сохранён как наблюдение, третий call не выполнялся E-021; artifacts/raw/run-1/telemetry.json Failure не замаскирован синтетическим ответом
2026-07-26 (run-1 evaluate) Deterministic evaluation сохранённых raw artifacts Qwen 3/6, DeepSeek 2/6, narration 4/4; telemetry 12/12 Unknown, human/billing evidence missing E-022 Strict outcome остаётся inconclusive
2026-07-26 (до run-2 calls) Measurement audit, RED fixes и датированный protocol amendment Выявлены два under-specified prompts и RU scorer false negatives; v1 сохранён, для run-2 зафиксирован rerun 8 cells + reuse 4 narrations E-023, E-024 Новые calls можно интерпретировать отдельно, без заднего изменения criteria
2026-07-26T13:49:57+07:00 Run-2 protocol + dry-run Зафиксирован preflight-v2 manifest SHA 6342c3f4…61c32; 8/8 graphs valid, 0 failed, 0 credits; 4 narration files помечены для reuse E-026 Correction bundle зафиксирован до paid calls
2026-07-26T13:51:59+07:00 Разрешённый correction batch Отправлены 8/8 scenario+intent workflows; все завершились, submission failures отсутствуют E-027 Provider correction evidence получен полностью
2026-07-26T06:59:43.919Z Run-2 artifact audit и deterministic evaluate 12/12 observed, 0 missing; revision-2 scorecard дал DeepSeek 6/6, Qwen 4/6; manual/billing missing E-028E-030 Историческое наблюдение; позднейший audit отменил model-selection вывод
2026-07-26T14:21:46+07:00 Run-3 protocol frozen до provider calls Protocol revision 3, 12 новых prompts/workflows, logical manifest a758d221…0ebfb8, full SHA 97805199…2d8f3; reuse запрещён E-031 Run-1/run-2 остаются историей, v3 измеряется отдельно
2026-07-26 (run-3 dry-run) OAuth parallel dry-run и sequential retry Parallel refresh-token race; повторная проверка строго последовательно прошла 12/12, 0 failed, 0 credits E-032 Для dry-run принята sequential policy; paid batch не выдаётся за per-job billing control
2026-07-26T14:29:58–14:36:59+07:00 Один разрешённый submit_batch 12 paid jobs стали ready, pending 0, failed 0; 12 valid JSON raw responses сохранены E-033, E-034 Provider execution complete; AC-07 не доказан без per-job balance
2026-07-26 (post-run audit) Frozen-raw evaluator RED/GREEN amendment Audit сохранил initial scorecard SHA/summary, но не полную отдельную копию; raw не менялись, provider rerun не было; canonical scorecard пересоздан Qwen 4/6, DeepSeek 4/6 E-035 Scorer correction прозрачно отделена от provider evidence
2026-07-26T15:08:28+07:00 Changes-review recovery initial scorecard Из current artifact, точно зафиксированных scorer deltas и исходного generatedAt восстановлены serialized bytes; SHA-256 совпал с hash до amendment E-038 До/после scorer теперь можно сравнить по полным artifacts; provenance reconstruction обозначен явно
2026-07-26T15:10–15:12+07:00 Fresh final gate, desktop/mobile E2E и bounded design scan Все repository gates прошли; два последовательных desktop clicks и mobile previous-document click подтверждены snapshots; page-level mobile overflow устранён, console clean E-039E-041 Published study package проверен после последней artifact/doc синхронизации
2026-07-26 (semantic audit) Independent agent grounding review Agent audit: Qwen 4/6, DeepSeek 3/6; Deep RU дополнительно fail за ungrounded age/gender E-036 Это agent semantic audit, не human naturalness review

Выводы#

  • Fact: run-1 и run-2 сохранены как исторические observations под своими evaluator revisions; их current-candidate conclusions superseded run-3 protocol. Основание: E-021E-031.
  • Inference: Flash-модели нужно оценивать как untrusted proposal/narration components, а не как source of truth. Основание: E-002, E-003.
  • Measurement: run-3 deterministic scorecard даёт обеим моделям 4/6: scenario 1/2, intent 2/2, narration 1/2. Agent semantic audit даёт Qwen 4/6 и DeepSeek 3/6. Основание: E-035, E-036.
  • Decision: ни одна модель не прошла bilingual 6/6; practical winner отсутствует. Сильный общий результат ограничен intent lane. Основание: E-035, E-036.
  • Unknown: human narration naturalness и фактический credit delta. Из-за missing manual/billing artifacts strict outcome inconclusive. Основание: E-034, E-037.

Рассмотренные альтернативы#

Подход Что проверили Почему не выбран Evidence
Gemini Flash Scope и openness Закрытая модель выходит за open-weight выборку scope decision
Один prompt, где модель и adjudicates, и narrates Authority boundary Смешивает роли и позволяет модели влиять на canonical state E-002
Параллельные 12 nodes Cost control Нет hard output cap; client-side stop невозможен между jobs E-006, E-007
Comfy только как transport, TypeScript как judge Reproducibility и safety Выбран: raw provider output отделён от deterministic evaluation E-002, E-003

Неизвестные#

  • Unknown: variance при repeats > 1 и других seeds.
  • Unknown: поведение на других жанрах, языках и длинном контексте.
  • Unknown: provider-reported latency/token usage run-3; telemetry Unknown для 12/12 cells.
  • Unknown: live credit balance и credit delta; generation tools доступны, но live billing status в текущем MCP toolset отсутствует (E-025).
  • Unknown: human naturalness score; автоматический scorer не заменяет human reviewer.
  • Unknown: repeatability при других seeds, genres и provider drift; run-3 содержит только один response на ячейку.
  • Unknown: executable free-text scenario branches и story coherence; structural compiler этого не измеряет.
  • Unknown: paraphrased/translated privacy leakage; exact-token check этого не измеряет.
  • Unknown: authoring Adventure/Map -> runtime compiler interoperability.