ブログ一覧

Clef はリンク正誤判定なら Sonnet 並み、バグ探しには使えない

ブログの関連記事を選ぶような作業なら、Cloudflare の判定モデル Clef に任せても Claude Sonnet 5.5 と同じくらい当たり、費用は約 16分の1 で済みます。一方、コードの差分からバグのありそうな所を挙げさせる用途には使えませんでした。Clef が怪しいとした所の当たり方は、無作為に選んだ場合とほとんど変わりませんでした。

Clef は 2026-10-01 に Cloudflare が出したモデルで、文章を書かずに「はい」か「いいえ」の確率だけを返します。Workers AI の API から呼べ、重みも公開されています。公式の告知にはベンチマークの数字しか無かったので、自分のブログとボットのリポジトリで、過去に自分が下した判断を正解にして試しました。

内部リンクは Sonnet 5.5 と同じくらい当たった

ブログの記事 A の本文の先頭と、候補の記事 B のタイトルと概要を渡し、「この記事を読んでいる人にとって、次の記事へのリンクは役に立ちますか?」と B ごとに聞きました。Sonnet 5.5 にも同じ文と同じ問いを渡し、「はい」の確からしさを 0〜100 で答えてもらっています。正解は、私が実際に記事に張った内部リンクです。今の関連記事の欄はタグが重なる記事を並べているので、その方法も一緒に測りました。

Workers AI は無料プランだと 1日に使える量に上限があり、137本の記事のうち 51本を測ったところで上限に達したので、比べる相手も同じ 51本で測っています。

結果は次のとおりです。AUC は、正解のリンク先を正解でない記事より上に並べられた確率で、0.5 なら当てずっぽう、1 なら完璧です。

  • タグの重なり: AUC 0.856、上位 3本のうちリンクを張っていた割合 33%
  • Clef: AUC 0.947、同 40%
  • Sonnet 5.5: AUC 0.949、同 40%

Clef と Sonnet 5.5 の差は 51本では誤差の範囲で、どちらもタグの重なりより正解のリンク先を上に並べています。費用は定価とトークン数から出した見積もりで、Clef が約 0.35 ドル、Sonnet 5.5 が約 5.5 ドルでした。

タグでは拾えないつながりも Clef は拾いました。「Nuxt3のApolloモジュールでBasic認証を使うには」から私がリンクしている「WordPressサイトで外部からのアクセスを拒否するには」は、タグの重なりだと 136本中 76位ですが、Clef は 1位に置きました。

ただし、Clef は同じ記事を何度も 1位にします。「Astro + Cloudflare で公開した記事が 404 のままになる原因」は、51本のうち 11本で Clef の 1位でした。そのまま関連記事の欄に使うと、多くの記事の下に同じ記事が並ぶことになります。

バグ探しでは、無作為に選ぶのとほとんど変わらなかった

こちらは私が運用している Slack のボットのリポジトリで試しました。マージ済みの PR の差分を、変更のまとまり(diff の hunk)ごとに分けて、「この範囲の変更に、マージする前に直すべき問題がありますか?」と聞いています。Sonnet 5.5 にも同じ差分と同じ問いを渡しました。正解は、マージした後にバグとして直された行です。

変更の箇所は全部で 400個あり、そのうち 73個(18.2%)が後で直されたバグを含んでいました。無作為に選んでも 18.2% は当たる計算です。Clef と Sonnet 5.5 がそれぞれ怪しいと答えた上位 2割(79個)のうち、バグを含んでいた割合は次のとおりでした。

  • Clef: 21.5%(17個)
  • Sonnet 5.5: 29.1%(23個)

Sonnet 5.5 は無作為より確かに多く当てました。Clef と無作為の差の 3ポイントは、偶然でも出る範囲です。

当てた例もあります。ビルドのスクリプトで画像処理のライブラリ sharp を Linux 向けに入れる設定の名前を間違えていた所を、Clef は 400個中 5位に置きました。一方、Slack のメッセージで 2 つのボタンに同じ ID を付けてしまい、メッセージが送れなくなった所は 355位でした。

費用は Clef が約 0.04 ドル、Sonnet 5.5 が約 1.6 ドルでした。

参考リンク

関連

この記事をシェア