Research: Flash LLM core evaluation
Baseline#
Existing vertical slice доказывает порядок
intent -> validate -> authoritative rules/RNG -> commit -> projection -> narration на fake adapters. Existing cost-quality study использует
fake_local, не делает provider calls и оставляет real quality, latency,
tokens, retries и cost как Unknown.
Authoring HostPreferences/AdventureDraft и runtime
HostPreferences/AdventureContract несовместимы и пока не связаны compiler
mapping. Поэтому три роли сравниваются отдельно.
Метод#
Фиксированная матрица#
models = qwen/qwen3.6-flash, deepseek/deepseek-v4-flash
languages = ru, en
roles = scenario, intent, narration
repeats = 1
seed = 20260726
calls = 2 × 2 × 3 × 1 = 12
Предрегистрация требовала отдельный последовательный Comfy job для каждого
call. Один workflow содержит только OpenRouterLLMNode -> SaveText. Reasoning
выключен. Comfy сохраняет сырой ответ; локальный TypeScript один раз парсит
JSON и выполняет schema, semantic, rules, state, continuity, privacy и
language checks. Фактическое отклонение run-1 от последовательного запуска
зафиксировано ниже и не скрывается.
Scenario#
Модель получает один original sci-fi comedy HostPreferences fixture,
targetLanguage и компактный structural contract. Выход — только
AdventureDraft. После safe unknown boundary выполняются:
- shape/schema validation;
validateAdventureDraft;sourceAdventureId === preferences.adventureId;compileAdventureContract;validateAdventureContract;- forbidden sentinel и language checks.
Intent#
Один call возвращает outputs для четырёх case IDs:
- valid insight check;
- syntactically valid, но unreachable move;
- ambiguous action;
- rules/secrets/roll injection.
Proposal проходит существующие parseCommandProposal и executeProposal.
Clarification/illegal cases проверяются на отсутствие event/state mutation.
Любой roll допустим только с source: "server".
Narration#
Один call получает две NarrationRequest: successful и failed committed
check. Модель видит только audience projection и committed event. Scorer
проверяет outcome, total, difficulty, effects, forbidden hidden fixture facts,
language signal и неизменность state hash.
Языковая rubric#
Для каждой из четырёх narration cells после deterministic language-signal check фиксируется одна ручная оценка:
| Score | Определение |
|---|---|
| 0 | Неверный язык, бессвязный или непригодный текст |
| 1 | Смысл понятен, но заметны смешение языков, неестественность или потеря тона |
| 2 | Свободный, естественный, пригодный для игры текст с требуемым playful bureaucratic tone |
Оценка 2 нужна для утверждения «language quality passed». Оценка не
выводится автоматически и не подменяет raw evidence.
Контроль стоимости#
Comfy не предоставляет hard per-run output token cap для
OpenRouterLLMNode. Preregistered soft control требовал sequential jobs,
reasoning_effort=off, balance до старта и после каждого job, прекращение
после превышения согласованной credit delta. Явное согласие на расход было
получено, однако live billing status в доступном MCP toolset отсутствовал.
В run-3 параллельный OAuth dry-run столкнулся с refresh-token race; dry-run
повторили строго последовательно и получили 12/12 valid graphs. Paid execution
затем был одним submit_batch на 12 jobs, а не per-job последовательностью с
billing checks. Credit delta восстановить нельзя, поэтому AC-07 не считается
доказанным.
Наблюдение run-1#
- Наблюдались 12/12 preregistered ячеек: 11 jobs вернули raw provider output, для Qwen RU intent сохранён пустой raw artifact с явной ошибкой.
- Первый Qwen RU intent
prompt_idне зарегистрировался; подтверждённый retry завершилсяjob.empty_output. - Telemetry по latency, tokens и credits остаётся Unknown для 12/12 ячеек.
- После исправления false-negative narration matcher deterministic результаты: Qwen 3/6, DeepSeek 2/6, narration 4/4 overall.
- Scenario и intent результаты нельзя интерпретировать как чистое сравнение моделей: их prompts оказались недостаточно точными относительно scorer contracts. Human narration naturalness и billing audit не выполнены.
Историческое наблюдение correction run-2#
- До paid calls сохранён correction protocol. Полный SHA-256
preflight-v2/manifest.json:6342c3f46b145de75b947cb55289c339ac441fe8a1cf7a1bf54d7ca29c361c32. - Dry-run проверил 8/8 исправленных scenario+intent workflows, 0 failed и 0 credits. После явного согласия correction batch завершил 8/8 jobs, failed at submission = 0.
- Четыре narration raw files переиспользованы из run-1. Pairwise SHA-256 совпадают byte-for-byte; provider rerun для них не выполнялся.
- Scorecard наблюдает 12/12 artifacts, missing 0 и telemetry Unknown 12/12. Manual review отсутствует: 0/4 narration cells. Billing audit отсутствует.
- DeepSeek проходит 6/6 deterministic cells: scenario 2/2, intent 2/2,
narration 2/2;
deterministicCorePassed=true. - Qwen проходит 4/6: intent 2/2 и narration 2/2, scenario 0/2. RU scenario
нарушил visibility schema в
storyFacts/1; EN scenario вернул нестроковыйclocks/0/whenFull.
Позднейший independent audit выявил answer leakage в intent case IDs и deterministic-scorer false positives. Поэтому run-2 numbers остаются историческими для evaluator revision 2 и не поддерживают текущий вывод о кандидате.
Текущее наблюдение run-3#
- Protocol revision 3 зафиксирован до provider calls: logical manifest
a758d221a63eb2f2600af570d8431764597bd8c3ae75d4960d94d8963e0ebfb8, полный preflight-v3 manifest SHA9780519911a6c7fc2ed3d6efacf292899a321d8156c0c36ec71ff3c553c2d8f3. - Все 12 role prompts/public contracts изменились, поэтому выполнены 12 новых paid jobs без reuse run-1/run-2 outputs. Job log: ready 12, pending 0, failed 0.
- Все 12 raw responses — valid JSON с сохранёнными SHA-256. Telemetry Unknown 12/12; manual naturalness review missing 0/4; billing audit missing.
- На момент evaluator audit initial scorecard хранился только как SHA-256 и
diagnostic summary. После changes review полная byte-exact версия
восстановлена в
artifacts/derived/run-3-scorecard-pre-amendment.json; SHA-25608236755…bbf2665совпадает с первоначально записанным hash. Это проверяемая реконструкция, а не original write-once snapshot. Raw files заморожены и остались byte-identical; provider rerun не выполнялся. - После behavior-level RED 18 pass / 2 expected fail и GREEN 20/20 canonical scorecard пересоздан. Deterministic totals: Qwen 4/6 и DeepSeek 4/6; оба scenario 1/2, intent 2/2, narration 1/2.
- Independent agent semantic audit — не human review — даёт Qwen 4/6 и DeepSeek 3/6. DeepSeek RU narration дополнительно fail strict grounding: «Юноша (Juno)» выдумывает отсутствующие в projection возраст и гендер.
- Scenario pass structural only: executable free-text predicates и coherence не измерены. Privacy check измеряет exact hidden-token matches, но не translated/paraphrased leakage.
Реестр доказательств#
| ID | Тип | Описание | Источник, путь или команда | Дата или версия |
|---|---|---|---|---|
| E-001 | Fact | Existing real-model metrics отсутствуют: fake adapter, 0 calls, quality/cost Unknown | ../2026-07-25-llm-routing-cost-quality/README.md |
2026-07-25 |
| E-002 | Fact | Runtime порядок commit-before-narration и projection boundary уже реализованы | ../2026-07-25-ai-gm-vertical-slice/prototype/src/orchestrator.ts |
working tree, 2026-07-26 |
| E-003 | Fact | Rich Adventure draft имеет semantic validators/compiler, но safe unknown boundary отсутствовал |
../2026-07-25-adventure-contract-generation/prototype/adventure.ts |
working tree, 2026-07-26 |
| E-004 | Fact | Qwen3.6-Flash связан с open-weight Qwen3.6-35B-A3B, Apache-2.0 | https://github.com/QwenLM/Qwen3.6#license-agreement | accessed 2026-07-26 |
| E-005 | Fact | DeepSeek-V4-Flash публикуется как open-weight checkpoint под MIT | https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash | accessed 2026-07-26 |
| E-006 | Fact | Official Comfy MCP exposes billing status and requires consent for paid generation | https://docs.comfy.org/agent-tools/mcp | accessed 2026-07-26 |
| E-007 | Fact | Current Partner Node prices: Qwen 56.57/339.45 and DeepSeek 33.79/67.59 credits per 1M input/output tokens | https://docs.comfy.org/tutorials/partner-nodes/pricing | accessed 2026-07-26 |
| E-008 | Unknown | Live balance, actual prompt/output tokens, credit delta и latency | artifacts/raw/run-1/telemetry.json; live billing method unavailable |
pending |
| E-009 | Measurement | Preflight создал 12 requests, 6 unique prompt hashes, 12 unique workflow hashes; manifest 310f4e6e184d6e0f1b18bdfa373690c9c8788230e06ec3647777ed9f352620c1 |
node prototype/run.ts prepare; artifacts/derived/preflight-v1/manifest.json |
2026-07-26T03:47+07:00 |
| E-010 | Measurement | Новый behavioral suite: 7/7 pass; strict TypeScript exit 0 | node --test prototype/run.test.ts; npm run typecheck |
Node 24.14.0; TypeScript 7.0.2 |
| E-011 | Measurement | Два read-only Codex billing probes не инициализировали MCP: HTTP 400 handshake, затем timeout awaiting tools/list after 30s; на момент probes paid calls ещё не было |
ephemeral codex exec; local terminal evidence |
Codex CLI 0.145.0; 2026-07-26T03:48–03:51+07:00 |
| E-012 | Fact | Qwen/DeepSeek expose reasoning effort; search_context_size относится к Perplexity Sonar и исключён из workflow |
https://docs.comfy.org/tutorials/partner-nodes/openrouter/llm | accessed 2026-07-26 |
| E-013 | Measurement | Полный локальный gate прошёл: site 4/4, technical 48/48, strict typecheck, 11 studies, build 101 docs, validation 259 HTML pages/27 837 links/3 462 anchors/55 presentation links/0 failures, Bun 2/2 | npm run check:all |
2026-07-26 |
| E-014 | Measurement | Живая библиотека открылась; после клика по Flash LLM core evaluation показала README, затем после клика по evidence-log — RESEARCH; browser console errors/warnings = 0 |
isolated playwright-cli session against http://127.0.0.1:8788 |
2026-07-26T04:02+07:00 |
| E-015 | Measurement | Design detector отработал на двух построенных HTML: обязательных блокеров нет; отмечены advisory generated-shell color/number markers и warning о пяти em dashes | impeccable detect --json dist/.../README.html dist/.../RESEARCH.html |
2026-07-26T04:03+07:00 |
| E-016 | Measurement | Review выявил premature pass: scorecard не требовал human naturalness и billing audit. RED test воспроизвёл pass; v2 gate теперь оставляет результат inconclusive без обоих artifacts и разрешает pass только с complete valid evidence |
prototype/run.test.ts; prototype/run.ts; targeted suite 8/8 |
2026-07-26 |
| E-017 | Measurement | Повторный OAuth login завершился успешно, но свежий read-only Codex probe снова не зарегистрировал Comfy tools: TypeError: tools.mcp__comfy_cloud__get_billing_status is not a function; shutdown сообщил failed initialize после HTTP 400 |
codex mcp login comfy-cloud; ephemeral codex exec |
Codex CLI 0.145.0; 2026-07-26T04:07–04:08+07:00 |
| E-018 | Measurement | Финальный после review полный gate прошёл: site 4/4, technical 49/49, strict typecheck, 11 studies, build 101 docs, validation 259 HTML pages/27 838 links/3 462 anchors/55 presentation links/0 failures, Bun 2/2 | npm run check:all |
2026-07-26 |
| E-019 | Measurement | Pre-run scorecard snapshot: 0/12 raw, manual review missing, billing audit missing, outcome inconclusive; provider calls на тот момент ещё не выполнялись |
node prototype/run.ts evaluate; historical local output |
2026-07-26T04:17+07:00 |
| E-020 | Measurement | Follow-up review выявил stale evidence reuse. Проверка logical manifestHash отклоняла unrelated manifests, но позднее v1/v2 показали, что этого недостаточно, если hash не включает protocol/prompt identity |
prototype/run.test.ts; prototype/run.ts; historical v2 limitation |
2026-07-26 |
| E-021 | Measurement | Run-1 наблюдал 12/12 ячеек и сохранил 11 raw provider outputs; Qwen RU intent: первый job не зарегистрирован, подтверждённый retry завершился job.empty_output |
artifacts/derived/run-1-jobs.json; artifacts/raw/run-1/responses/ |
2026-07-26 |
| E-022 | Measurement | Исправленный deterministic scorecard: Qwen 3/6, DeepSeek 2/6, narration 4/4; telemetry Unknown 12/12; manual review и billing audit missing; outcome inconclusive |
node prototype/run.ts evaluate; artifacts/derived/run-1-scorecard.json; artifacts/raw/run-1/telemetry.json |
2026-07-26 |
| E-023 | Measurement | Audit выявил under-specified intent CommandProposal, scenario array/null requirements и RU narration false negatives из-за JavaScript \w/verb coverage; исправления воспроизведены RED tests и проходят targeted suite |
prototype/prompts/intent.txt; prototype/prompts/scenario.txt; prototype/evaluation.ts; prototype/run.test.ts |
2026-07-26 |
| E-024 | Decision | До новых paid calls зарегистрирован correction protocol: отдельный preflight-v2, rerun только 8 scenario+intent cells, reuse 4 неизменённых narration outputs без provider rerun; v1 history не перезаписывается | README.md, раздел Protocol amendment; этот журнал |
2026-07-26 |
| E-025 | Unknown | Generation через официальный MCP стала доступна, но live billing status и фактический credit delta run-1 получить нельзя | exposed Comfy MCP toolset; artifacts/raw/run-1/telemetry.json |
2026-07-26 |
| E-026 | Measurement | Correction protocol сохранил v1 history, определил 8 provider reruns + 4 narration reuses и идентифицировал correction bundle полным preflight-v2 manifest SHA 6342c3f4…61c32; dry-run 8/8, 0 failed, 0 credits |
artifacts/derived/run-2-protocol.json; artifacts/derived/preflight-v2/manifest.json |
2026-07-26T13:49:57+07:00 |
| E-027 | Measurement | Разрешённый correction batch отправил 8/8 workflows; все 8 jobs завершились, failed at submission = 0; prompt IDs и output URLs сохранены | artifacts/derived/run-2-jobs.json |
submitted 2026-07-26T13:51:59+07:00 |
| E-028 | Measurement | Четыре narration files в run-2 byte-identical соответствующим run-1 files; pairwise SHA-256 совпали, provider rerun не выполнялся | shasum -a 256 artifacts/raw/run-{1,2}/responses/*narration*.json; artifacts/derived/run-2-protocol.json |
2026-07-26 |
| E-029 | Historical measurement | Run-2 scorecard under evaluator revision 2: observed 12/12, DeepSeek 6/6, Qwen 4/6. Позднейший audit обнаружил answer leakage/false positives, поэтому это не current model-selection evidence | artifacts/derived/run-2-scorecard.json; superseded by artifacts/derived/run-3-protocol.json |
generated 2026-07-26T06:59:43.919Z |
| E-030 | Historical unknown | Run-2 human naturalness 0/4 и billing audit missing; strict outcome был inconclusive даже до обнаружения measurement defects |
artifacts/derived/run-2-scorecard.json |
2026-07-26 |
| E-031 | Decision | Run-3 protocol revision 3 сохранил prior runs, запретил rescore/reuse, убрал answer-bearing intent IDs и усилил scenario/narration instrument; logical manifest a758d221…0ebfb8, full preflight SHA 97805199…2d8f3 |
artifacts/derived/run-3-protocol.json; artifacts/derived/preflight-v3/manifest.json |
2026-07-26T14:21:46+07:00 |
| E-032 | Operational measurement | Параллельный OAuth dry-run столкнулся с refresh-token race; повторная проверка выполнялась последовательно и завершила 12/12 graphs, 0 failed, 0 credits. Paid run позднее отправлен одним batch, не per-job | run-3 execution observation; artifacts/derived/run-3-protocol.json |
dry-run complete 2026-07-26T14:29:29+07:00 |
| E-033 | Measurement | Один разрешённый run-3 batch отправил 12 paid jobs; final summary ready 12, pending 0, failed 0; prompt IDs и output URLs сохранены | artifacts/derived/run-3-jobs.json |
2026-07-26T14:29:58–14:36:59+07:00 |
| E-034 | Measurement | Run-3 содержит 12/12 valid JSON raw responses с SHA-256; missing 0; telemetry Unknown 12/12, retryCount 0/error null; manual review 0/4 и billing audit missing | artifacts/raw/run-3/; artifacts/raw/run-3/telemetry.json; artifacts/derived/run-3-scorecard.json |
2026-07-26 |
| E-035 | Measurement | Evaluator audit зафиксировал initial scorecard hash, заморозил 12 raw hashes и запретил provider rerun; RED 18/2 expected failures, GREEN 20/0; canonical scorecard пересоздан: Qwen 4/6, DeepSeek 4/6 | artifacts/derived/run-3-evaluator-audit.json; artifacts/derived/run-3-scorecard.json |
recorded 2026-07-26T14:41:17+07:00 |
| E-036 | Agent semantic audit | Independent agent audit, не human naturalness review: Qwen 4/6, DeepSeek 3/6; DeepSeek RU narration fail strict grounding из-за ungrounded «Юноша (Juno)» | artifacts/derived/run-3-evaluator-audit.json → independentReview |
2026-07-26 |
| E-037 | Measurement limit | Scenario gate structural only; executable exit predicates, story coherence/host fit не измерены. Privacy exact-token measured, paraphrase leakage not measured; human naturalness missing, billing delta Unknown | artifacts/derived/run-3-protocol.json; artifacts/derived/run-3-evaluator-audit.json |
2026-07-26 |
| E-038 | Recovered measurement artifact | Полный pre-amendment scorecard восстановлен byte-exact после review; его SHA-256 08236755…bbf2665 совпадает с hash, записанным до regeneration canonical path. Это reconstruction, не original write-once snapshot |
artifacts/derived/run-3-scorecard-pre-amendment.json; artifacts/derived/run-3-evaluator-audit.json |
recovered 2026-07-26T15:08:28+07:00 |
| E-039 | Measurement | Fresh repository gate после artifact/doc sync: site 5/5, technical 61/61, strict typecheck, 11 studies, build 101 docs, validation 272 HTML pages/28 099 local links/3 493 anchors/55 presentation links/0 failures, Bun 2/2 | npm run check:all |
2026-07-26T15:10+07:00 |
| E-040 | Browser measurement | Isolated Playwright desktop flow: library → README → RESEARCH; console 0 errors/warnings. На 390×844 RESEARCH и README имеют document.scrollWidth=390; таблица сохраняет внутренний auto-scroll 356/672; mobile previous-document click работает |
playwright-cli; http://127.0.0.1:8788 |
2026-07-26T15:10–15:12+07:00 |
| E-041 | Advisory design check | Bounded scan двух built HTML завершён; detector сообщил только advisory/warning для generated shell, document prose и порядковых evidence codes, без verification blocker | impeccable detect --json dist/.../README.html dist/.../RESEARCH.html |
2026-07-26T15:12+07:00 |
Журнал экспериментов#
| Время | Изменение или попытка | Наблюдение | Artifact или evidence ID | Вывод |
|---|---|---|---|---|
| 2026-07-26T03:15:00+07:00 | Предрегистрация вопроса и матрицы до model calls | Зафиксированы 12 calls, seed, roles, languages, assertions и pass rule | README.md, E-001–E-007 |
Можно строить локальный harness без расхода credits |
| 2026-07-26T03:47:00+07:00 | Local prepare + TDD verification | 12 single-call workflows; manifest 310f4e6e…620c1; 7/7 tests; typecheck clean |
E-009, E-010 |
Локальный evaluator готов, generation не выполнялась |
| 2026-07-26T03:48:00+07:00 | Free get_billing_status probe |
MCP initialization failed twice before billing tool became callable | E-011 |
На этом этапе live balance и paid execution были blocked; calls ещё не выполнялись |
| 2026-07-26 | Первый полный check:all |
Build обнаружил unresolved double-brace placeholders в трёх prompt templates с расширением .md |
local command output | Ошибка была в выборе renderable extension, а не в model harness |
| 2026-07-26 | Prompt templates переименованы .md -> .txt, полный gate повторён |
Все локальные проверки прошли, включая 48 technical tests и validation построенного сайта | E-013 |
Неуспешная попытка сохранена в журнале; исправление подтверждено полным прогоном |
| 2026-07-26T04:02:00+07:00 | Browser E2E и advisory design scan | Два последовательных клика открыли README и RESEARCH нового исследования; browser console чист; detector не нашёл blocking issue | E-014, E-015 |
Документ доступен пользователю в живой библиотеке |
| 2026-07-26 | Changes review и outcome-gate regression | RED показал, что 12 deterministic passes давали преждевременный pass; после v2 gate отсутствие manual/billing evidence даёт inconclusive, а complete audit допускает pass |
E-016 |
Final claim теперь соответствует preregistered AC-06 и AC-07 |
| 2026-07-26T04:07:00+07:00 | Повторная OAuth-авторизация и free billing probe | OAuth success; Streamable HTTP tools всё равно не прошли initialize/list, billing method отсутствует в fresh child | E-017 |
На этом этапе paid calls ещё не выполнялись |
| 2026-07-26T04:17:00+07:00 | Финальный local gate и pre-run v2 evaluate | 49/49 technical tests, весь repository gate clean; scorecard snapshot фиксировал 12 missing raw и inconclusive |
E-018, E-019 |
Preflight завершён; это историческое состояние до provider run |
| 2026-07-26 | Follow-up review: stale evidence binding | RED подтвердил, что foreign manifest принимался при тех же request IDs; оба audit artifacts теперь проверяются против текущего manifest hash | E-020 |
Старые manual/billing файлы не могут подтвердить новый run |
| 2026-07-26 (run-1) | Первый paid call и подтверждённый batch оставшихся 11 cells | 11 provider outputs сохранены; один Qwen RU intent prompt ID не зарегистрирован | E-021; artifacts/derived/run-1-jobs.json |
Real-model evidence получен, но run содержит provider failure |
| 2026-07-26 (run-1 retry) | Подтверждённый retry Qwen RU intent | Job завершился без output; job.empty_output сохранён как наблюдение, третий call не выполнялся |
E-021; artifacts/raw/run-1/telemetry.json |
Failure не замаскирован синтетическим ответом |
| 2026-07-26 (run-1 evaluate) | Deterministic evaluation сохранённых raw artifacts | Qwen 3/6, DeepSeek 2/6, narration 4/4; telemetry 12/12 Unknown, human/billing evidence missing | E-022 |
Strict outcome остаётся inconclusive |
| 2026-07-26 (до run-2 calls) | Measurement audit, RED fixes и датированный protocol amendment | Выявлены два under-specified prompts и RU scorer false negatives; v1 сохранён, для run-2 зафиксирован rerun 8 cells + reuse 4 narrations | E-023, E-024 |
Новые calls можно интерпретировать отдельно, без заднего изменения criteria |
| 2026-07-26T13:49:57+07:00 | Run-2 protocol + dry-run | Зафиксирован preflight-v2 manifest SHA 6342c3f4…61c32; 8/8 graphs valid, 0 failed, 0 credits; 4 narration files помечены для reuse |
E-026 |
Correction bundle зафиксирован до paid calls |
| 2026-07-26T13:51:59+07:00 | Разрешённый correction batch | Отправлены 8/8 scenario+intent workflows; все завершились, submission failures отсутствуют | E-027 |
Provider correction evidence получен полностью |
| 2026-07-26T06:59:43.919Z | Run-2 artifact audit и deterministic evaluate | 12/12 observed, 0 missing; revision-2 scorecard дал DeepSeek 6/6, Qwen 4/6; manual/billing missing | E-028–E-030 |
Историческое наблюдение; позднейший audit отменил model-selection вывод |
| 2026-07-26T14:21:46+07:00 | Run-3 protocol frozen до provider calls | Protocol revision 3, 12 новых prompts/workflows, logical manifest a758d221…0ebfb8, full SHA 97805199…2d8f3; reuse запрещён |
E-031 |
Run-1/run-2 остаются историей, v3 измеряется отдельно |
| 2026-07-26 (run-3 dry-run) | OAuth parallel dry-run и sequential retry | Parallel refresh-token race; повторная проверка строго последовательно прошла 12/12, 0 failed, 0 credits | E-032 |
Для dry-run принята sequential policy; paid batch не выдаётся за per-job billing control |
| 2026-07-26T14:29:58–14:36:59+07:00 | Один разрешённый submit_batch |
12 paid jobs стали ready, pending 0, failed 0; 12 valid JSON raw responses сохранены | E-033, E-034 |
Provider execution complete; AC-07 не доказан без per-job balance |
| 2026-07-26 (post-run audit) | Frozen-raw evaluator RED/GREEN amendment | Audit сохранил initial scorecard SHA/summary, но не полную отдельную копию; raw не менялись, provider rerun не было; canonical scorecard пересоздан Qwen 4/6, DeepSeek 4/6 | E-035 |
Scorer correction прозрачно отделена от provider evidence |
| 2026-07-26T15:08:28+07:00 | Changes-review recovery initial scorecard | Из current artifact, точно зафиксированных scorer deltas и исходного generatedAt восстановлены serialized bytes; SHA-256 совпал с hash до amendment |
E-038 |
До/после scorer теперь можно сравнить по полным artifacts; provenance reconstruction обозначен явно |
| 2026-07-26T15:10–15:12+07:00 | Fresh final gate, desktop/mobile E2E и bounded design scan | Все repository gates прошли; два последовательных desktop clicks и mobile previous-document click подтверждены snapshots; page-level mobile overflow устранён, console clean | E-039–E-041 |
Published study package проверен после последней artifact/doc синхронизации |
| 2026-07-26 (semantic audit) | Independent agent grounding review | Agent audit: Qwen 4/6, DeepSeek 3/6; Deep RU дополнительно fail за ungrounded age/gender | E-036 |
Это agent semantic audit, не human naturalness review |
Выводы#
- Fact: run-1 и run-2 сохранены как исторические observations под своими
evaluator revisions; их current-candidate conclusions superseded run-3
protocol. Основание:
E-021–E-031. - Inference: Flash-модели нужно оценивать как untrusted proposal/narration
components, а не как source of truth. Основание:
E-002,E-003. - Measurement: run-3 deterministic scorecard даёт обеим моделям 4/6:
scenario 1/2, intent 2/2, narration 1/2. Agent semantic audit даёт Qwen 4/6
и DeepSeek 3/6. Основание:
E-035,E-036. - Decision: ни одна модель не прошла bilingual 6/6; practical winner
отсутствует. Сильный общий результат ограничен intent lane. Основание:
E-035,E-036. - Unknown: human narration naturalness и фактический credit delta. Из-за
missing manual/billing artifacts strict outcome
inconclusive. Основание:E-034,E-037.
Рассмотренные альтернативы#
| Подход | Что проверили | Почему не выбран | Evidence |
|---|---|---|---|
| Gemini Flash | Scope и openness | Закрытая модель выходит за open-weight выборку | scope decision |
| Один prompt, где модель и adjudicates, и narrates | Authority boundary | Смешивает роли и позволяет модели влиять на canonical state | E-002 |
| Параллельные 12 nodes | Cost control | Нет hard output cap; client-side stop невозможен между jobs | E-006, E-007 |
| Comfy только как transport, TypeScript как judge | Reproducibility и safety | Выбран: raw provider output отделён от deterministic evaluation | E-002, E-003 |
Неизвестные#
- Unknown: variance при repeats > 1 и других seeds.
- Unknown: поведение на других жанрах, языках и длинном контексте.
- Unknown: provider-reported latency/token usage run-3; telemetry Unknown для 12/12 cells.
- Unknown: live credit balance и credit delta; generation tools доступны,
но live billing status в текущем MCP toolset отсутствует (
E-025). - Unknown: human naturalness score; автоматический scorer не заменяет human reviewer.
- Unknown: repeatability при других seeds, genres и provider drift; run-3 содержит только один response на ячейку.
- Unknown: executable free-text scenario branches и story coherence; structural compiler этого не измеряет.
- Unknown: paraphrased/translated privacy leakage; exact-token check этого не измеряет.
- Unknown: authoring Adventure/Map -> runtime compiler interoperability.