「開発現場で Claude Code を使い倒す」シリーズ最終回。今回は「盛らせない」検算をコードで持つ話です。AIはもっともらしい数字を、自信満々に作ります。とくに数値が入る成果物――レポート、集計、見積――は危険です。私たちがAIを使うときの背骨は、これ一本に尽きます。数字はAIに作らせない。作った出力は、機械で検算する。
AIに数字を作らせない
数値の集計はプログラムでやり、AIには集計済みの値だけを渡して、要約や整形をさせる。この役割分担が基本です。AIに「データを見て合計を出して」と頼むと、それらしい数字が返ってきますが、正しさは保証されません。計算はコード、言葉はAI、と切り分けます。
出力の数値を、元データと機械照合する
それでも、AIが要約の途中で数字を書き換えてしまうことはあります。そこで、生成された文章に出てくる数値を1つずつ抜き出して、元データに含まれるかを機械で照合します。私たちの実例では、保守レポートの下書きで本文中の数値138個のうち136個が元データと一致(自社2サイト×2か月の4本での機械照合)。別のサイト診断では151個中151個が実測値と一致(自社5サイト×2方式)でした。一致しなかったものは人が確認する――この関門があるから、数字入りの文書でもAIを使えます。
母数を「先に」固定する
数字を出すときは、母数と条件をセットにします。そして母数は測る前に固定する。あとから「どれを数えるか」を選べてしまうと、都合のいい数字が作れてしまうからです。ある画像判定の検証では、数える対象を規則(カタカナ4文字以上など)で機械的に抽出し、判定より先に母数を確定させました。規則はコードに書いてあって、後から動かせません。「AIが良い数字を出した」ではなく「良い数字が出る余地を先に潰した」状態を作ります。
確信度は、当てになるとは限らない
AIは「どれくらい自信があるか」を返せますが、これが正誤と相関するかはタスク次第です。ある画像判定では、誤りには低い自信・正解には高い自信がきれいに付き、確信度での足切りが効きました。ところが別のテキスト判定では、誤った答えに自信90超えが平気で付き、確信度は当てになりませんでした。だから「自信が高いから正しい」とは扱わず、そのタスクで確信度が使えるかを実測してから使います。
文書・記事でも、機械で門番を置く
この考え方はコードだけの話ではありません。このブログ記事群を作ったときも、「書いてはいけない表現」を grep で拾い、必須の数値(母数つき)が入っているかを機械で確認してから公開しました(シリーズ第1回参照)。人の目視だけに頼らず、チェックできるものは機械に落とす。そのうえで、最終確認と確定は人が持つ。
まとめ ― 「速く間違える」を避ける
- 数字はAIに作らせない。集計はコード、要約はAI。
- 出力の数値は元データと機械照合。一致しないものは人が確認する。
- 母数は測る前に固定する。あとから選べる状態を作らない。
- 確信度が使えるかはタスクごとに実測する。
- チェックできるものは機械に落とし、確定は人が持つ。
AIを入れると速くなりますが、検算を省くと「速く間違える」仕組みになります。速いのは下書きまで、確定は人が持つ――これが、私たちがAIを実務に載せるときの一貫した型です。全6回のシリーズにお付き合いいただき、ありがとうございました。
Analyzegear


