# Prototype Harness готовит 12 immutable single-call Comfy workflows и оценивает сохранённые raw ответы локальным TypeScript-кодом. Unit tests и repository checks никогда не вызывают paid provider. Default CLI `prepare`/`evaluate` читает исторические preflight-v1/run-1 paths. Run-2 также исторический: его candidate conclusion superseded после measurement audit. Current run-3 использует exported `prepareEvaluation(outputRoot)` и `evaluateSavedResponses(rawRoot, outputPath)` с `preflight-v3`, `raw/run-3` и `run-3-scorecard.json`. Все 12 cells выполнены новыми paid jobs в одном batch; prior outputs не переиспользуются. Итоговый `pass` требует не только deterministic role gates, но и `manual-review.json` для четырёх narration cells и последовательный `billing-audit.json` для всех 12 jobs. При отсутствии любого из этих artifacts scorecard остаётся `inconclusive`; оба artifacts в run-3 отсутствуют. Run-3 manifest schema включает `protocolRevision: 3`. Logical manifest `a758d221a63eb2f2600af570d8431764597bd8c3ae75d4960d94d8963e0ebfb8`; bundle identity — полный SHA-256 `preflight-v3/manifest.json` `9780519911a6c7fc2ed3d6efacf292899a321d8156c0c36ec71ff3c553c2d8f3`. Post-run evaluator audit сохранил initial scorecard SHA/diagnostic summary и все raw hashes. После changes review полный initial scorecard восстановлен byte-exact как `run-3-scorecard-pre-amendment.json`; hash совпадает с зафиксированным до regeneration. Это reconstruction, не original write-once snapshot. Raw files остались byte-identical; provider rerun не было. Canonical scorecard после RED/GREEN amendment: Qwen 4/6, DeepSeek 4/6. Agent semantic audit отдельно даёт Qwen 4/6, DeepSeek 3/6 и не является human review. Scenario gate structural only; executable exits/coherence не измеряются. Privacy gate exact-token only; paraphrased leakage не измеряется. Точные команды находятся в [`../SOLUTION.md`](../SOLUTION.md), а фактические результаты — в [`../VALIDATION.md`](../VALIDATION.md).