結果がほぼ同じ判定に Claude は Jev の 70倍以上の費用がかかった
日本語の技術ブログ 137本で、記事どうしの内部リンクの関連度を Jev と Claude Sonnet 5.5 に付けさせ、同じ記事・同じ情報・同じ正解で比べました。AUC(リンクすべき記事を、すべきでない記事より上に並べられた確率。1.0 なら完全、0.5 ならでたらめ)は Jev が 0.94、Sonnet 5.5 が 0.971 です。一方で費用は Sonnet 5.5 が Jev の 70倍以上かかり、応答も約 5倍遅くなりました。
Jev を日本語で試して思ったほど当たらないと感じていても、このチェックに関しては汎用の LLM に替えて得られる精度はわずかです。自サイトの内部リンク関連度チェックなら Jev で足ります。
同じ情報を渡して比べた
正解は、137本の本文に既にある同じサイトの記事へのリンク 273本です。記事ごとに残り 136本を候補にして、正解をどれだけ上に並べられるかで比べました。
両者に渡した情報は同じです。読んでいる記事 A はタイトル・概要・本文の先頭 1,500字、候補の B はタイトルと概要です。違うのは問い方で、それぞれの普通の使い方に合わせました。
- Jev: 組ごとに「A を読んでいる人に B へのリンクは役に立つか」を問い、「はい」の確率を点にする。記事 A ごとに 136組をまとめて 1回で送った
- Sonnet 5.5: 記事 A ごとに 1回、候補 136本の一覧を渡し、「次に読んでもらうリンク先としての役立ち度」を 0〜100点で全部に付けさせた。呼び出しは Claude Code の CLI(
claude -p)
Jev は 2026-09-19、Sonnet 5.5 は 2026-09-30 に測りました。どちらも 1回ずつの値です。
精度の差は小さい
AUC は次のとおりでした。
- Claude Sonnet 5.5: 0.971
- Jev: 0.94
- タグの一致(2本のタグの重なりの割合。今の関連記事はこれで出している): 0.883
既存のリンクを持つ記事ごとに、そのリンク先のうち点の上位 5件に入った割合を出し、記事で平均すると次のとおりです。
- Claude Sonnet 5.5: 78%
- Jev: 69%
- タグの一致: 54%
Sonnet 5.5 の方が上ですが、差は AUC で 0.03、上位 5件で 9ポイントです。Jev の値も、タグの一致をはっきり上回っています。
費用と速さの差は大きい
記事 1本分(136候補)の応答時間の中央値は、Sonnet 5.5 が 4.84秒、Jev が 0.93秒でした。
137回の費用は、Jev が API の定価で約 0.12 ドルです。Sonnet 5.5 は 1回に約 3万トークンを読み込み、API の定価に実際のトークン数を掛けると約 9.1 ドルになりました。この額は見積もりで、請求額ではありません。
自サイトの内部リンク関連度チェックなら Jev で足りる
Sonnet 5.5 に替えて上がる精度は、上位 5件に正解が入る割合で 9ポイントです。その代わりに、137本を 1回見直すたびの費用は 70倍以上、待ち時間は約 5倍になります。
Jev がほかにどんな判定に向くかは 判定専用モデル Jev が LLM の代わりに使える処理と使えない処理 にまとめています。