LLM に台本を判定させたら 12本すべて通した
X に投稿している 4 コマ漫画の台本を AI エージェントに書かせ、別の LLM(判定役、Claude Sonnet)に通すか落とすかを判定させています。判定役は最初の 12本をすべて通し、私が採用したのは 2本でした。判定のモデルを替えても私の選択には近づかず、通る台本が出たのは、生成の手前で素材を絞り、判定の文面に私が通した例と落とした例を書き込んでからです。
流れは、台本の元になる一文の出来事(素材)を選び、エージェントが台本(コマごとの場面とセリフ)を書き、判定役が判定し、最後に私が読んで投稿するかを決める、の 4段です。本文で「私が通した」と書くのは、投稿に採用したという意味です。
書く役と判定役を分けても、判定役は 12本すべてを通した
台本を書く役と判定する役は、別々のサブエージェント(Claude Code が作業を任せる子のエージェント)にしています。判定役には台本だけを渡し、なぜその話を選んだかは渡しません。素材を選んだ側は、作業の中にいた者にとっての新しさで台本を評価してしまうためです。
判定役への問いは「文脈を知らない人が 1 コマ目で状況を掴み、うちにもあると言えるか」の 1つです。「バズりそうか」ではなく「誰かに送りたくなるか」を見させ、判定、誰が誰に送るか、理由の 3行を返させます。
判定: 通す
送る: SREがログ整備をサボっている後輩に「うちも他人事じゃない」と言って送る
理由: 1コマ目で障害直後の詰問と即座に把握でき、ログもなく気合で締めるオチに既視感がある最初の判定文面で判定させた 12本に、判定役はすべて「通す」を返しました。私が通したのはそのうち 2本で、1本は迷った末に通した、ぎりぎりの 1本です。12本は、素材と書き方を 4 通りに変えながら作りました。
- 作業中の出来事をそのまま素材にした 3本: 3本とも落とした。面白さもオチも無く、読んだ人が何かする理由が無かった
- 同じ 3つの素材で、漫画の書き方の規則を入れて作り直した 3本: 通したのは 1本(ぎりぎり)。残り 2本は前よりは良くなったが、採用には届かなかった
- 依存パッケージの更新や git の落とし穴を素材にした 2本: 2本とも落とした。X の読み手が 1 コマ目で自分の経験を重ねられなかった
- AI エージェントに任せた結果を素材にした 4本: 通したのは 1本。作業を任せた別のエージェントが「PR 待ってます」と言いながら、実は動いていなかった話
判定役は、私が落とした台本にも同じ具体さで「送る」の行を書いていました。誰に送るかを書けても、その台本を実際に誰かが送るとは限りません。
判定のモデルを替えても、私の選択には近づかなかった
問いは変えずにモデルだけを替えて私の選択に近づくかを見るために、私が通すか落とすかを決めた素材の一文 32件(通したのは 2件)を、2つのモデルに判定させました。
- 問いを渡すと yes/no の確率を返す分類専用のモデル、Jev
- 文脈を持たない Claude Sonnet
問いは 4つです。
- うちにもあるか
- 読み手が同じ失敗に陥りうるか
- 笑うかぎょっとするか
- 同僚に送りたくなるか
測ったのは、私が通した 2件に、落とした 30件より高い yes の確率を付けた割合です。0.5 なら偶然と同じです。4つの問いで Jev は 0.42〜0.63、Sonnet は 0.10〜0.80 で、どちらも見分けられていません。通した例が 2件しか無いので、1件入れ替わるだけで 0.3 前後動き、どちらのモデルが上かも言えません。比較の詳細は Jev が LLM の代わりに使えた処理と任せられなかった処理 に書きました。
台本を書く手前で書き方の規則と素材の基準を直してから、通す台本が出た
台本を書くサブエージェントには、漫画の書き方の規則が入っていませんでした。入れたのは次の 5つです。
- 3 コマ目から 4 コマ目の落差
- 本文はつぶやき程度の 40字
- 主人公は 1人
- 身体の動きを描く
- 煽らない
同じ素材で作り直すと台本は良くなり、1本をぎりぎり通しました。一方、依存パッケージの更新や git の落とし穴を素材にした台本は、規則を入れても全部落としました。私の作業の中では大きな出来事でも、X の読み手が自分の経験を重ねられる話ではありませんでした。
そこで素材を選ぶ基準を、事情を知らない人に一文で話して笑うかぎょっとするかに変え、一文の主語を「AI エージェントに任せた結果」か「本番で起きたこと」に限りました。変えた次の回で、「PR 待ってます」と言っていた任せた先のエージェントが実は動いていなかった台本を、私が通しました。
この基準で、AI エージェントと進めた作業の日ごとの記録から素材の候補を拾うと 20件で、私が採ったのは 1件だけでした。残り 19件は、私の環境でしか起きないか、読み手が得る物の無い話です。そこで基準に「読み手が同じ道具で同じ失敗に陥りうるか」を足しました。
私が通して X に投稿した台本は、いまのところ 3本です。ぎりぎり通した作り直しの 1本、「PR 待ってます」の台本、作業の記録から採った素材の 1本で、どれも書き方の規則か素材の基準を直したあとに出てきました。
判定の文面に通す例と落とす例を書き込んだ
「PR 待ってます」の台本を通したのは、流れが分かりやすく、AI エージェントと働くエンジニアなら覚えのある話だったからです。オチは「動いてませんでした」という報告への落胆だけで足りていました。同じ回に作って私が落とした 3本は、どれも教訓や決意、作り手側の事情で終わっていました。
私が見ていたのは、持ち帰れる事実があるかでも、誰が誰に送るかでもなく、1〜3 コマの流れを読み手が自分で経験したことがあるかでした。判定の文面には次の物を足しました。
- 「うちにもある」は、1〜3 コマの流れを読み手が経験したことがある、という意味
- オチは落胆の一言で足りる
- 教訓・決意・手順で終わる台本は落とす
- 通す例として「PR 待ってます」の台本、落とす例として同じ回の 3本
書き直した判定に同じ回の 4本を判定させると、3本を落とし、「PR 待ってます」だけを通しました。ただしこれは判定に書き込んだ例そのものなので、判定が良くなった証拠にはなりません。作業の記録から採った素材で作った台本 2案は、2案とも通り、私もその素材を通しました。書き直した判定が台本を落とすところは、まだ見ていません。
いま私がしているのは、次の 3つです。
- 生成の手前で素材を絞る(基準は「事情を知らない人に一文で話して反応があるか」と「読み手が同じ失敗に陥りうるか」)
- 判定の文面に、自分が通した例と落とした例、その理由を書き込む
- 判定役と自分の判定を並べて表に残し、食い違いが溜まったら問いと例を直す。溜まるまでは判定役の「通す」を信用しない
判定役が判定したあとも、投稿するかは私が読んで決めます。