# Research: Flash LLM core evaluation ## Baseline Existing vertical slice доказывает порядок `intent -> validate -> authoritative rules/RNG -> commit -> projection -> narration` на fake adapters. Existing cost-quality study использует `fake_local`, не делает provider calls и оставляет real quality, latency, tokens, retries и cost как Unknown. Authoring `HostPreferences`/`AdventureDraft` и runtime `HostPreferences`/`AdventureContract` несовместимы и пока не связаны compiler mapping. Поэтому три роли сравниваются отдельно. ## Метод ### Фиксированная матрица ```text models = qwen/qwen3.6-flash, deepseek/deepseek-v4-flash languages = ru, en roles = scenario, intent, narration repeats = 1 seed = 20260726 calls = 2 × 2 × 3 × 1 = 12 ``` Предрегистрация требовала отдельный последовательный Comfy job для каждого call. Один workflow содержит только `OpenRouterLLMNode -> SaveText`. Reasoning выключен. Comfy сохраняет сырой ответ; локальный TypeScript один раз парсит JSON и выполняет schema, semantic, rules, state, continuity, privacy и language checks. Фактическое отклонение run-1 от последовательного запуска зафиксировано ниже и не скрывается. ### Scenario Модель получает один original sci-fi comedy `HostPreferences` fixture, `targetLanguage` и компактный structural contract. Выход — только `AdventureDraft`. После safe unknown boundary выполняются: 1. shape/schema validation; 2. `validateAdventureDraft`; 3. `sourceAdventureId === preferences.adventureId`; 4. `compileAdventureContract`; 5. `validateAdventureContract`; 6. forbidden sentinel и language checks. ### Intent Один call возвращает outputs для четырёх case IDs: 1. valid insight check; 2. syntactically valid, но unreachable move; 3. ambiguous action; 4. rules/secrets/roll injection. Proposal проходит существующие `parseCommandProposal` и `executeProposal`. Clarification/illegal cases проверяются на отсутствие event/state mutation. Любой roll допустим только с `source: "server"`. ### Narration Один call получает две `NarrationRequest`: successful и failed committed check. Модель видит только audience projection и committed event. Scorer проверяет outcome, total, difficulty, effects, forbidden hidden fixture facts, language signal и неизменность state hash. ### Языковая rubric Для каждой из четырёх narration cells после deterministic language-signal check фиксируется одна ручная оценка: | Score | Определение | |---:|---| | 0 | Неверный язык, бессвязный или непригодный текст | | 1 | Смысл понятен, но заметны смешение языков, неестественность или потеря тона | | 2 | Свободный, естественный, пригодный для игры текст с требуемым playful bureaucratic tone | Оценка `2` нужна для утверждения «language quality passed». Оценка не выводится автоматически и не подменяет raw evidence. ### Контроль стоимости Comfy не предоставляет hard per-run output token cap для `OpenRouterLLMNode`. Preregistered soft control требовал sequential jobs, `reasoning_effort=off`, balance до старта и после каждого job, прекращение после превышения согласованной credit delta. Явное согласие на расход было получено, однако live billing status в доступном MCP toolset отсутствовал. В run-3 параллельный OAuth dry-run столкнулся с refresh-token race; dry-run повторили строго последовательно и получили 12/12 valid graphs. Paid execution затем был одним `submit_batch` на 12 jobs, а не per-job последовательностью с billing checks. Credit delta восстановить нельзя, поэтому AC-07 не считается доказанным. ### Наблюдение run-1 - Наблюдались 12/12 preregistered ячеек: 11 jobs вернули raw provider output, для Qwen RU intent сохранён пустой raw artifact с явной ошибкой. - Первый Qwen RU intent `prompt_id` не зарегистрировался; подтверждённый retry завершился `job.empty_output`. - Telemetry по latency, tokens и credits остаётся Unknown для 12/12 ячеек. - После исправления false-negative narration matcher deterministic результаты: Qwen 3/6, DeepSeek 2/6, narration 4/4 overall. - Scenario и intent результаты нельзя интерпретировать как чистое сравнение моделей: их prompts оказались недостаточно точными относительно scorer contracts. Human narration naturalness и billing audit не выполнены. ### Историческое наблюдение correction run-2 - До paid calls сохранён correction protocol. Полный SHA-256 `preflight-v2/manifest.json`: `6342c3f46b145de75b947cb55289c339ac441fe8a1cf7a1bf54d7ca29c361c32`. - Dry-run проверил 8/8 исправленных scenario+intent workflows, 0 failed и 0 credits. После явного согласия correction batch завершил 8/8 jobs, failed at submission = 0. - Четыре narration raw files переиспользованы из run-1. Pairwise SHA-256 совпадают byte-for-byte; provider rerun для них не выполнялся. - Scorecard наблюдает 12/12 artifacts, missing 0 и telemetry Unknown 12/12. Manual review отсутствует: 0/4 narration cells. Billing audit отсутствует. - DeepSeek проходит 6/6 deterministic cells: scenario 2/2, intent 2/2, narration 2/2; `deterministicCorePassed=true`. - Qwen проходит 4/6: intent 2/2 и narration 2/2, scenario 0/2. RU scenario нарушил visibility schema в `storyFacts/1`; EN scenario вернул нестроковый `clocks/0/whenFull`. Позднейший independent audit выявил answer leakage в intent case IDs и deterministic-scorer false positives. Поэтому run-2 numbers остаются историческими для evaluator revision 2 и не поддерживают текущий вывод о кандидате. ### Текущее наблюдение run-3 - Protocol revision 3 зафиксирован до provider calls: logical manifest `a758d221a63eb2f2600af570d8431764597bd8c3ae75d4960d94d8963e0ebfb8`, полный preflight-v3 manifest SHA `9780519911a6c7fc2ed3d6efacf292899a321d8156c0c36ec71ff3c553c2d8f3`. - Все 12 role prompts/public contracts изменились, поэтому выполнены 12 новых paid jobs без reuse run-1/run-2 outputs. Job log: ready 12, pending 0, failed 0. - Все 12 raw responses — valid JSON с сохранёнными SHA-256. Telemetry Unknown 12/12; manual naturalness review missing 0/4; billing audit missing. - На момент evaluator audit initial scorecard хранился только как SHA-256 и diagnostic summary. После changes review полная byte-exact версия восстановлена в `artifacts/derived/run-3-scorecard-pre-amendment.json`; SHA-256 `08236755…bbf2665` совпадает с первоначально записанным hash. Это проверяемая реконструкция, а не original write-once snapshot. Raw files заморожены и остались byte-identical; provider rerun не выполнялся. - После behavior-level RED 18 pass / 2 expected fail и GREEN 20/20 canonical scorecard пересоздан. Deterministic totals: Qwen 4/6 и DeepSeek 4/6; оба scenario 1/2, intent 2/2, narration 1/2. - Independent agent semantic audit — не human review — даёт Qwen 4/6 и DeepSeek 3/6. DeepSeek RU narration дополнительно fail strict grounding: «Юноша (Juno)» выдумывает отсутствующие в projection возраст и гендер. - Scenario pass structural only: executable free-text predicates и coherence не измерены. Privacy check измеряет exact hidden-token matches, но не translated/paraphrased leakage. ## Реестр доказательств | ID | Тип | Описание | Источник, путь или команда | Дата или версия | |---|---|---|---|---| | E-001 | Fact | Existing real-model metrics отсутствуют: fake adapter, 0 calls, quality/cost Unknown | `../2026-07-25-llm-routing-cost-quality/README.md` | 2026-07-25 | | E-002 | Fact | Runtime порядок commit-before-narration и projection boundary уже реализованы | `../2026-07-25-ai-gm-vertical-slice/prototype/src/orchestrator.ts` | working tree, 2026-07-26 | | E-003 | Fact | Rich Adventure draft имеет semantic validators/compiler, но safe `unknown` boundary отсутствовал | `../2026-07-25-adventure-contract-generation/prototype/adventure.ts` | working tree, 2026-07-26 | | E-004 | Fact | Qwen3.6-Flash связан с open-weight Qwen3.6-35B-A3B, Apache-2.0 | | accessed 2026-07-26 | | E-005 | Fact | DeepSeek-V4-Flash публикуется как open-weight checkpoint под MIT | | accessed 2026-07-26 | | E-006 | Fact | Official Comfy MCP exposes billing status and requires consent for paid generation | | accessed 2026-07-26 | | E-007 | Fact | Current Partner Node prices: Qwen 56.57/339.45 and DeepSeek 33.79/67.59 credits per 1M input/output tokens | | accessed 2026-07-26 | | E-008 | Unknown | Live balance, actual prompt/output tokens, credit delta и latency | `artifacts/raw/run-1/telemetry.json`; live billing method unavailable | pending | | E-009 | Measurement | Preflight создал 12 requests, 6 unique prompt hashes, 12 unique workflow hashes; manifest `310f4e6e184d6e0f1b18bdfa373690c9c8788230e06ec3647777ed9f352620c1` | `node prototype/run.ts prepare`; `artifacts/derived/preflight-v1/manifest.json` | 2026-07-26T03:47+07:00 | | E-010 | Measurement | Новый behavioral suite: 7/7 pass; strict TypeScript exit 0 | `node --test prototype/run.test.ts`; `npm run typecheck` | Node 24.14.0; TypeScript 7.0.2 | | E-011 | Measurement | Два read-only Codex billing probes не инициализировали MCP: HTTP 400 handshake, затем timeout awaiting `tools/list` after 30s; на момент probes paid calls ещё не было | ephemeral `codex exec`; local terminal evidence | Codex CLI 0.145.0; 2026-07-26T03:48–03:51+07:00 | | E-012 | Fact | Qwen/DeepSeek expose reasoning effort; `search_context_size` относится к Perplexity Sonar и исключён из workflow | | accessed 2026-07-26 | | E-013 | Measurement | Полный локальный gate прошёл: site 4/4, technical 48/48, strict typecheck, 11 studies, build 101 docs, validation 259 HTML pages/27 837 links/3 462 anchors/55 presentation links/0 failures, Bun 2/2 | `npm run check:all` | 2026-07-26 | | E-014 | Measurement | Живая библиотека открылась; после клика по `Flash LLM core evaluation` показала README, затем после клика по evidence-log — RESEARCH; browser console errors/warnings = 0 | isolated `playwright-cli` session against `http://127.0.0.1:8788` | 2026-07-26T04:02+07:00 | | E-015 | Measurement | Design detector отработал на двух построенных HTML: обязательных блокеров нет; отмечены advisory generated-shell color/number markers и warning о пяти em dashes | `impeccable detect --json dist/.../README.html dist/.../RESEARCH.html` | 2026-07-26T04:03+07:00 | | E-016 | Measurement | Review выявил premature `pass`: scorecard не требовал human naturalness и billing audit. RED test воспроизвёл `pass`; v2 gate теперь оставляет результат `inconclusive` без обоих artifacts и разрешает `pass` только с complete valid evidence | `prototype/run.test.ts`; `prototype/run.ts`; targeted suite 8/8 | 2026-07-26 | | E-017 | Measurement | Повторный OAuth login завершился успешно, но свежий read-only Codex probe снова не зарегистрировал Comfy tools: `TypeError: tools.mcp__comfy_cloud__get_billing_status is not a function`; shutdown сообщил failed initialize после HTTP 400 | `codex mcp login comfy-cloud`; ephemeral `codex exec` | Codex CLI 0.145.0; 2026-07-26T04:07–04:08+07:00 | | E-018 | Measurement | Финальный после review полный gate прошёл: site 4/4, technical 49/49, strict typecheck, 11 studies, build 101 docs, validation 259 HTML pages/27 838 links/3 462 anchors/55 presentation links/0 failures, Bun 2/2 | `npm run check:all` | 2026-07-26 | | E-019 | Measurement | Pre-run scorecard snapshot: 0/12 raw, manual review missing, billing audit missing, outcome `inconclusive`; provider calls на тот момент ещё не выполнялись | `node prototype/run.ts evaluate`; historical local output | 2026-07-26T04:17+07:00 | | E-020 | Measurement | Follow-up review выявил stale evidence reuse. Проверка logical `manifestHash` отклоняла unrelated manifests, но позднее v1/v2 показали, что этого недостаточно, если hash не включает protocol/prompt identity | `prototype/run.test.ts`; `prototype/run.ts`; historical v2 limitation | 2026-07-26 | | E-021 | Measurement | Run-1 наблюдал 12/12 ячеек и сохранил 11 raw provider outputs; Qwen RU intent: первый job не зарегистрирован, подтверждённый retry завершился `job.empty_output` | `artifacts/derived/run-1-jobs.json`; `artifacts/raw/run-1/responses/` | 2026-07-26 | | E-022 | Measurement | Исправленный deterministic scorecard: Qwen 3/6, DeepSeek 2/6, narration 4/4; telemetry Unknown 12/12; manual review и billing audit missing; outcome `inconclusive` | `node prototype/run.ts evaluate`; `artifacts/derived/run-1-scorecard.json`; `artifacts/raw/run-1/telemetry.json` | 2026-07-26 | | E-023 | Measurement | Audit выявил under-specified intent `CommandProposal`, scenario array/null requirements и RU narration false negatives из-за JavaScript `\w`/verb coverage; исправления воспроизведены RED tests и проходят targeted suite | `prototype/prompts/intent.txt`; `prototype/prompts/scenario.txt`; `prototype/evaluation.ts`; `prototype/run.test.ts` | 2026-07-26 | | E-024 | Decision | До новых paid calls зарегистрирован correction protocol: отдельный preflight-v2, rerun только 8 scenario+intent cells, reuse 4 неизменённых narration outputs без provider rerun; v1 history не перезаписывается | `README.md`, раздел `Protocol amendment`; этот журнал | 2026-07-26 | | E-025 | Unknown | Generation через официальный MCP стала доступна, но live billing status и фактический credit delta run-1 получить нельзя | exposed Comfy MCP toolset; `artifacts/raw/run-1/telemetry.json` | 2026-07-26 | | E-026 | Measurement | Correction protocol сохранил v1 history, определил 8 provider reruns + 4 narration reuses и идентифицировал correction bundle полным preflight-v2 manifest SHA `6342c3f4…61c32`; dry-run 8/8, 0 failed, 0 credits | `artifacts/derived/run-2-protocol.json`; `artifacts/derived/preflight-v2/manifest.json` | 2026-07-26T13:49:57+07:00 | | E-027 | Measurement | Разрешённый correction batch отправил 8/8 workflows; все 8 jobs завершились, failed at submission = 0; prompt IDs и output URLs сохранены | `artifacts/derived/run-2-jobs.json` | submitted 2026-07-26T13:51:59+07:00 | | E-028 | Measurement | Четыре narration files в run-2 byte-identical соответствующим run-1 files; pairwise SHA-256 совпали, provider rerun не выполнялся | `shasum -a 256 artifacts/raw/run-{1,2}/responses/*narration*.json`; `artifacts/derived/run-2-protocol.json` | 2026-07-26 | | E-029 | Historical measurement | Run-2 scorecard under evaluator revision 2: observed 12/12, DeepSeek 6/6, Qwen 4/6. Позднейший audit обнаружил answer leakage/false positives, поэтому это не current model-selection evidence | `artifacts/derived/run-2-scorecard.json`; superseded by `artifacts/derived/run-3-protocol.json` | generated 2026-07-26T06:59:43.919Z | | E-030 | Historical unknown | Run-2 human naturalness 0/4 и billing audit missing; strict outcome был `inconclusive` даже до обнаружения measurement defects | `artifacts/derived/run-2-scorecard.json` | 2026-07-26 | | E-031 | Decision | Run-3 protocol revision 3 сохранил prior runs, запретил rescore/reuse, убрал answer-bearing intent IDs и усилил scenario/narration instrument; logical manifest `a758d221…0ebfb8`, full preflight SHA `97805199…2d8f3` | `artifacts/derived/run-3-protocol.json`; `artifacts/derived/preflight-v3/manifest.json` | 2026-07-26T14:21:46+07:00 | | E-032 | Operational measurement | Параллельный OAuth dry-run столкнулся с refresh-token race; повторная проверка выполнялась последовательно и завершила 12/12 graphs, 0 failed, 0 credits. Paid run позднее отправлен одним batch, не per-job | run-3 execution observation; `artifacts/derived/run-3-protocol.json` | dry-run complete 2026-07-26T14:29:29+07:00 | | E-033 | Measurement | Один разрешённый run-3 batch отправил 12 paid jobs; final summary ready 12, pending 0, failed 0; prompt IDs и output URLs сохранены | `artifacts/derived/run-3-jobs.json` | 2026-07-26T14:29:58–14:36:59+07:00 | | E-034 | Measurement | Run-3 содержит 12/12 valid JSON raw responses с SHA-256; missing 0; telemetry Unknown 12/12, retryCount 0/error null; manual review 0/4 и billing audit missing | `artifacts/raw/run-3/`; `artifacts/raw/run-3/telemetry.json`; `artifacts/derived/run-3-scorecard.json` | 2026-07-26 | | E-035 | Measurement | Evaluator audit зафиксировал initial scorecard hash, заморозил 12 raw hashes и запретил provider rerun; RED 18/2 expected failures, GREEN 20/0; canonical scorecard пересоздан: Qwen 4/6, DeepSeek 4/6 | `artifacts/derived/run-3-evaluator-audit.json`; `artifacts/derived/run-3-scorecard.json` | recorded 2026-07-26T14:41:17+07:00 | | E-036 | Agent semantic audit | Independent agent audit, не human naturalness review: Qwen 4/6, DeepSeek 3/6; DeepSeek RU narration fail strict grounding из-за ungrounded «Юноша (Juno)» | `artifacts/derived/run-3-evaluator-audit.json` → `independentReview` | 2026-07-26 | | E-037 | Measurement limit | Scenario gate structural only; executable exit predicates, story coherence/host fit не измерены. Privacy exact-token measured, paraphrase leakage not measured; human naturalness missing, billing delta Unknown | `artifacts/derived/run-3-protocol.json`; `artifacts/derived/run-3-evaluator-audit.json` | 2026-07-26 | | E-038 | Recovered measurement artifact | Полный pre-amendment scorecard восстановлен byte-exact после review; его SHA-256 `08236755…bbf2665` совпадает с hash, записанным до regeneration canonical path. Это reconstruction, не original write-once snapshot | `artifacts/derived/run-3-scorecard-pre-amendment.json`; `artifacts/derived/run-3-evaluator-audit.json` | recovered 2026-07-26T15:08:28+07:00 | | E-039 | Measurement | Fresh repository gate после artifact/doc sync: site 5/5, technical 61/61, strict typecheck, 11 studies, build 101 docs, validation 272 HTML pages/28 099 local links/3 493 anchors/55 presentation links/0 failures, Bun 2/2 | `npm run check:all` | 2026-07-26T15:10+07:00 | | E-040 | Browser measurement | Isolated Playwright desktop flow: library → README → RESEARCH; console 0 errors/warnings. На 390×844 RESEARCH и README имеют `document.scrollWidth=390`; таблица сохраняет внутренний auto-scroll 356/672; mobile previous-document click работает | `playwright-cli`; `http://127.0.0.1:8788` | 2026-07-26T15:10–15:12+07:00 | | E-041 | Advisory design check | Bounded scan двух built HTML завершён; detector сообщил только advisory/warning для generated shell, document prose и порядковых evidence codes, без verification blocker | `impeccable detect --json dist/.../README.html dist/.../RESEARCH.html` | 2026-07-26T15:12+07:00 | ## Журнал экспериментов | Время | Изменение или попытка | Наблюдение | Artifact или evidence ID | Вывод | |---|---|---|---|---| | 2026-07-26T03:15:00+07:00 | Предрегистрация вопроса и матрицы до model calls | Зафиксированы 12 calls, seed, roles, languages, assertions и pass rule | `README.md`, `E-001`–`E-007` | Можно строить локальный harness без расхода credits | | 2026-07-26T03:47:00+07:00 | Local prepare + TDD verification | 12 single-call workflows; manifest `310f4e6e…620c1`; 7/7 tests; typecheck clean | `E-009`, `E-010` | Локальный evaluator готов, generation не выполнялась | | 2026-07-26T03:48:00+07:00 | Free `get_billing_status` probe | MCP initialization failed twice before billing tool became callable | `E-011` | На этом этапе live balance и paid execution были blocked; calls ещё не выполнялись | | 2026-07-26 | Первый полный `check:all` | Build обнаружил unresolved double-brace placeholders в трёх prompt templates с расширением `.md` | local command output | Ошибка была в выборе renderable extension, а не в model harness | | 2026-07-26 | Prompt templates переименованы `.md` -> `.txt`, полный gate повторён | Все локальные проверки прошли, включая 48 technical tests и validation построенного сайта | `E-013` | Неуспешная попытка сохранена в журнале; исправление подтверждено полным прогоном | | 2026-07-26T04:02:00+07:00 | Browser E2E и advisory design scan | Два последовательных клика открыли README и RESEARCH нового исследования; browser console чист; detector не нашёл blocking issue | `E-014`, `E-015` | Документ доступен пользователю в живой библиотеке | | 2026-07-26 | Changes review и outcome-gate regression | RED показал, что 12 deterministic passes давали преждевременный `pass`; после v2 gate отсутствие manual/billing evidence даёт `inconclusive`, а complete audit допускает `pass` | `E-016` | Final claim теперь соответствует preregistered AC-06 и AC-07 | | 2026-07-26T04:07:00+07:00 | Повторная OAuth-авторизация и free billing probe | OAuth success; Streamable HTTP tools всё равно не прошли initialize/list, billing method отсутствует в fresh child | `E-017` | На этом этапе paid calls ещё не выполнялись | | 2026-07-26T04:17:00+07:00 | Финальный local gate и pre-run v2 evaluate | 49/49 technical tests, весь repository gate clean; scorecard snapshot фиксировал 12 missing raw и `inconclusive` | `E-018`, `E-019` | Preflight завершён; это историческое состояние до provider run | | 2026-07-26 | Follow-up review: stale evidence binding | RED подтвердил, что foreign manifest принимался при тех же request IDs; оба audit artifacts теперь проверяются против текущего manifest hash | `E-020` | Старые manual/billing файлы не могут подтвердить новый run | | 2026-07-26 (run-1) | Первый paid call и подтверждённый batch оставшихся 11 cells | 11 provider outputs сохранены; один Qwen RU intent prompt ID не зарегистрирован | `E-021`; `artifacts/derived/run-1-jobs.json` | Real-model evidence получен, но run содержит provider failure | | 2026-07-26 (run-1 retry) | Подтверждённый retry Qwen RU intent | Job завершился без output; `job.empty_output` сохранён как наблюдение, третий call не выполнялся | `E-021`; `artifacts/raw/run-1/telemetry.json` | Failure не замаскирован синтетическим ответом | | 2026-07-26 (run-1 evaluate) | Deterministic evaluation сохранённых raw artifacts | Qwen 3/6, DeepSeek 2/6, narration 4/4; telemetry 12/12 Unknown, human/billing evidence missing | `E-022` | Strict outcome остаётся `inconclusive` | | 2026-07-26 (до run-2 calls) | Measurement audit, RED fixes и датированный protocol amendment | Выявлены два under-specified prompts и RU scorer false negatives; v1 сохранён, для run-2 зафиксирован rerun 8 cells + reuse 4 narrations | `E-023`, `E-024` | Новые calls можно интерпретировать отдельно, без заднего изменения criteria | | 2026-07-26T13:49:57+07:00 | Run-2 protocol + dry-run | Зафиксирован preflight-v2 manifest SHA `6342c3f4…61c32`; 8/8 graphs valid, 0 failed, 0 credits; 4 narration files помечены для reuse | `E-026` | Correction bundle зафиксирован до paid calls | | 2026-07-26T13:51:59+07:00 | Разрешённый correction batch | Отправлены 8/8 scenario+intent workflows; все завершились, submission failures отсутствуют | `E-027` | Provider correction evidence получен полностью | | 2026-07-26T06:59:43.919Z | Run-2 artifact audit и deterministic evaluate | 12/12 observed, 0 missing; revision-2 scorecard дал DeepSeek 6/6, Qwen 4/6; manual/billing missing | `E-028`–`E-030` | Историческое наблюдение; позднейший audit отменил model-selection вывод | | 2026-07-26T14:21:46+07:00 | Run-3 protocol frozen до provider calls | Protocol revision 3, 12 новых prompts/workflows, logical manifest `a758d221…0ebfb8`, full SHA `97805199…2d8f3`; reuse запрещён | `E-031` | Run-1/run-2 остаются историей, v3 измеряется отдельно | | 2026-07-26 (run-3 dry-run) | OAuth parallel dry-run и sequential retry | Parallel refresh-token race; повторная проверка строго последовательно прошла 12/12, 0 failed, 0 credits | `E-032` | Для dry-run принята sequential policy; paid batch не выдаётся за per-job billing control | | 2026-07-26T14:29:58–14:36:59+07:00 | Один разрешённый `submit_batch` | 12 paid jobs стали ready, pending 0, failed 0; 12 valid JSON raw responses сохранены | `E-033`, `E-034` | Provider execution complete; AC-07 не доказан без per-job balance | | 2026-07-26 (post-run audit) | Frozen-raw evaluator RED/GREEN amendment | Audit сохранил initial scorecard SHA/summary, но не полную отдельную копию; raw не менялись, provider rerun не было; canonical scorecard пересоздан Qwen 4/6, DeepSeek 4/6 | `E-035` | Scorer correction прозрачно отделена от provider evidence | | 2026-07-26T15:08:28+07:00 | Changes-review recovery initial scorecard | Из current artifact, точно зафиксированных scorer deltas и исходного `generatedAt` восстановлены serialized bytes; SHA-256 совпал с hash до amendment | `E-038` | До/после scorer теперь можно сравнить по полным artifacts; provenance reconstruction обозначен явно | | 2026-07-26T15:10–15:12+07:00 | Fresh final gate, desktop/mobile E2E и bounded design scan | Все repository gates прошли; два последовательных desktop clicks и mobile previous-document click подтверждены snapshots; page-level mobile overflow устранён, console clean | `E-039`–`E-041` | Published study package проверен после последней artifact/doc синхронизации | | 2026-07-26 (semantic audit) | Independent agent grounding review | Agent audit: Qwen 4/6, DeepSeek 3/6; Deep RU дополнительно fail за ungrounded age/gender | `E-036` | Это agent semantic audit, не human naturalness review | ## Выводы - **Fact:** run-1 и run-2 сохранены как исторические observations под своими evaluator revisions; их current-candidate conclusions superseded run-3 protocol. Основание: `E-021`–`E-031`. - **Inference:** Flash-модели нужно оценивать как untrusted proposal/narration components, а не как source of truth. Основание: `E-002`, `E-003`. - **Measurement:** run-3 deterministic scorecard даёт обеим моделям 4/6: scenario 1/2, intent 2/2, narration 1/2. Agent semantic audit даёт Qwen 4/6 и DeepSeek 3/6. Основание: `E-035`, `E-036`. - **Decision:** ни одна модель не прошла bilingual 6/6; practical winner отсутствует. Сильный общий результат ограничен intent lane. Основание: `E-035`, `E-036`. - **Unknown:** human narration naturalness и фактический credit delta. Из-за missing manual/billing artifacts strict outcome `inconclusive`. Основание: `E-034`, `E-037`. ## Рассмотренные альтернативы | Подход | Что проверили | Почему не выбран | Evidence | |---|---|---|---| | Gemini Flash | Scope и openness | Закрытая модель выходит за open-weight выборку | scope decision | | Один prompt, где модель и adjudicates, и narrates | Authority boundary | Смешивает роли и позволяет модели влиять на canonical state | `E-002` | | Параллельные 12 nodes | Cost control | Нет hard output cap; client-side stop невозможен между jobs | `E-006`, `E-007` | | Comfy только как transport, TypeScript как judge | Reproducibility и safety | Выбран: raw provider output отделён от deterministic evaluation | `E-002`, `E-003` | ## Неизвестные - **Unknown:** variance при repeats > 1 и других seeds. - **Unknown:** поведение на других жанрах, языках и длинном контексте. - **Unknown:** provider-reported latency/token usage run-3; telemetry Unknown для 12/12 cells. - **Unknown:** live credit balance и credit delta; generation tools доступны, но live billing status в текущем MCP toolset отсутствует (`E-025`). - **Unknown:** human naturalness score; автоматический scorer не заменяет human reviewer. - **Unknown:** repeatability при других seeds, genres и provider drift; run-3 содержит только один response на ячейку. - **Unknown:** executable free-text scenario branches и story coherence; structural compiler этого не измеряет. - **Unknown:** paraphrased/translated privacy leakage; exact-token check этого не измеряет. - **Unknown:** authoring Adventure/Map -> runtime compiler interoperability.