なぜ一つの生成AIだけでは不十分なのか
――「一致」よりも「不一致」に価値がある
一つの生成AIだけでは不十分だと私が考える理由は、生成AIが優秀ではないからではありません。むしろ非常に優秀だからこそ、そのもっともらしい回答を、そのまま「正解」として採用してしまうリスクがあるからです。
生成AIには、事実とは異なる内容を、あたかも正しい情報であるかのように生成してしまう「ハルシネーション(Hallucination)」と呼ばれる問題があります。
しかし、注意すべきなのは、明らかな事実誤認だけではありません。
個々の事実は正しくても、前提条件を取り違えているかもしれない。
論理的には成立していても、技術的には実現が難しいかもしれない。
あるいは、もっともらしい提案であっても、クライアントが本当に解決したい経営課題からずれているかもしれません。
そこで私は、重要なコンサルティング業務では、一つのAIが出した回答を別のAIにも検証させる「AIクロスレビュー」を行っています。
ただし、その目的は複数のAIに多数決をさせることではありません。
むしろ私が注目するのは、AI同士の意見が一致しなかったときです。
なぜ、一つのAIだけ違うことを言っているのか。
そこに、自分や他のAIが見落としていた論点やリスクが潜んでいる可能性があるからです。
私は、複数の生成AIを使う大きな価値の一つは、
一致よりも「不一致」にある
と考えています。
一つのAIに「作成」と「検証」の両方を任せない
生成AIに質問すると、驚くほど整った回答が返ってくることがあります。
論理的に見える。
文章も自然である。
専門用語も適切に使われている。
すると、つい「これは正しいだろう」と思ってしまいます。
しかし、
「もっともらしいこと」と「正しいこと」は同じではありません。
これは、人間の仕事とそれほど違わないと思います。
自分で作成した資料を何度読み返しても気づかなかった間違いを、別の人が読んだ瞬間に指摘することがあります。
そこで私は、重要な成果物については、最初の回答を作ったAIだけに品質確認を任せないようにしています。
別のAIから、別の視点を意図的に入れる。
そして、
「AIが間違っていないか」だけでなく、「別の視点から見ても、この結論は妥当なのか」
を検証する。
これが、私がAIクロスレビューを行う理由です。
実際に3つのAIへ役割を与えてみた
前回ご紹介したWebマーケティング支援案件では、ChatGPTを中心に分析と成果物作成を進めました。
しかし、ChatGPTだけで完結させたわけではありません。
分析結果が一通り出そろった段階で、ClaudeとGeminiにも参加してもらいました。
この案件では、私は3つのAIにおおむね次のような役割を与えました。
ChatGPT:分析、構成、全体の統合
Claude:論理面からのレビュー
Gemini:技術面からのレビュー
たとえばClaudeには、
「分析から結論への論理的な飛躍はないか」
「提案の根拠は十分か」
「全体として論理的な矛盾はないか」
といった観点を中心にチェックしてもらいました。
Geminiには、
「SEOやAEOに関する技術的な説明は妥当か」
「データの解釈に問題はないか」
「提案した施策は技術的に実現可能か」
といった観点を中心に確認してもらいました。
ただし、これは、
「Claudeは論理に強い」「Geminiは技術に強い」
という一般論を述べているわけではありません。
生成AIのモデルは猛烈な速度で進化しています。現在の特徴が将来も同じとは限りません。
重要なのは製品ごとの優劣ではなく、その仕事に応じて、複数のAIに異なる役割と視点を与えることだと考えています。
レビューの方法そのものもAIと設計する
もう一つ、今回工夫したことがあります。
ClaudeやGeminiに、
「この分析をチェックしてください」
とだけ依頼したわけではありません。
何を、どのような観点からレビューしてもらうのか。そのプロンプト自体もChatGPTと一緒に設計しました。
論理をチェックするのであれば、どこを見るべきなのか。
技術をチェックするのであれば、何を検証すべきなのか。
レビューの目的と役割を明確にしたうえで、それぞれのAIに仕事を依頼しました。
これは実際にやってみると重要でした。
複数のAIに同じ資料を渡して、
「どう思いますか?」
と聞くだけでは、それぞれが異なる観点から自由に回答するため、結果を比較しにくくなります。
一方、
「あなたには、この観点からレビューしてほしい」
と役割を明確にすれば、AIから返ってくる指摘の意味も明確になります。
つまり、AIクロスレビューでも、
誰に、何を、どの観点から検証させるのか
を設計する必要があります。
3つのAIのうち、2つが賛成したら正しいのか
では、複数のAIに同じ問題を検討させたとしましょう。
たとえば、
AI A:賛成
AI B:賛成
AI C:反対
という結果になったとします。
2対1です。
では、
「多数決で賛成」
と判断すればよいのでしょうか。
私は、そうは考えていません。
むしろ、このとき最も確認したいのは、
「なぜCだけが反対したのか?」
です。
Cだけが、AとBが考慮していなかった前提条件を見ているのかもしれません。
AとBが見落としたリスクを発見しているのかもしれません。
逆に、Cだけが誤った情報や前提に基づいて判断している可能性もあります。
重要なのは、
何対何になったかではなく、なぜ答えが分かれたのか
を調べることです。
AIは投票者ではありません。
複数のAIを使う目的は、正解を多数決で決めることではなく、異なる視点を意図的に持ち込み、自分が気づいていない論点を発見することだと私は考えています。
一致よりも「不一致」に価値がある
もちろん、複数のAIが同じ結論に到達すれば、一つの安心材料にはなります。
しかし、3つのAIが同じことを言ったからといって、それだけで正しいことが証明されるわけではありません。
同じ誤った情報を参照しているかもしれません。
同じような前提に立っているかもしれません。
あるいは、こちらの質問の仕方によって、似た回答へ誘導してしまった可能性もあります。
それに対して、一つのAIだけが違う意見を出した場合には、
「なぜ?」
という新しい問いが生まれます。
この「なぜ?」を掘り下げることで、それまで見えていなかった前提条件やリスクが浮かび上がることがあります。
私はここに、AIクロスレビューの大きな価値があると感じています。
一致は安心材料になる。
しかし、不一致は思考材料になる。
複数の生成AIを使う目的は、「自分の考えに賛成してくれるAIを増やすこと」ではありません。
むしろ、自分の考えに異論を唱える存在を意図的につくることに意味があるのではないでしょうか。
クロスレビューは3回行った
今回の案件では、AIクロスレビューを一度だけ行ったわけではありません。
全部で3回行いました。
第1回 分析結果のクロスレビュー
第1回は、一通りの分析が完了した段階です。
ここで、
Claude:論理チェック
Gemini:技術チェック
という異なる役割を与えました。
この段階で確認したかったのは、提案書の文章表現や見栄えではありません。
その後の提案の土台となる分析そのものが妥当なのか
という点です。
論理的な飛躍や矛盾はないか。
技術的な理解やデータの解釈に問題はないか。
異なる視点から分析結果を検証しました。
第2回 提案書のクロスレビュー
第2回は、提案書を作成した段階です。
前回ご紹介した通り、最終的な提案書は約100ページ、全9章になりました。
これを一度に作成したのではなく、1章ずつ作成し、内容を確認しながら積み上げました。
9章すべてが完成したところで一つの提案書として統合し、まずChatGPTに全体の整合性を確認させました。
そのうえで、再び、
Claude:論理チェック
Gemini:技術チェック
という役割でクロスレビューを行いました。
ここでは、分析そのものだけではなく、成果物としてまとめられた提案書が論理面・技術面から妥当なのかを検証しました。
そして、それぞれから出された指摘を確認し、必要な修正を加えていきました。
第3回 完成版の最終品質チェック
そして第3回が、修正後の完成版に対する最終品質チェックです。
ここでは、それまでとは方法を変えました。
Claudeには論理、Geminiには技術という異なる役割を与えるのではなく、
ClaudeとGeminiの両方に、同じプロンプトを与えました。
同じ完成版の提案書を、同じ条件で、それぞれ独立してチェックしてもらったのです。
つまり、第1回と第2回では、
「異なる視点から見る」
ことを重視しました。
一方、第3回では、
「同じ条件で別々に見る」
ことを重視しました。
クロスレビューといっても、毎回同じ方法を繰り返したわけではありません。
何を確認したいのかによって、AIへの役割の与え方そのものを変えた
ということです。
3回のクロスレビューを振り返る
今回のプロセスを簡略化すると、次のようになります。

第1回と第2回では、異なる役割を与えることで、できるだけ異なる角度から問題を見るようにしました。
そして最後は、同じ問いを二つのAIに投げることで、完成版を独立して検証しました。
こうして振り返ると、私が行ったAIクロスレビューは、単純な「ダブルチェック」とも少し違います。
検証する対象と目的に応じて、AIの組み合わせ方や問い方を変える。
これも、AIオーケストレーションの一つの重要なポイントだと感じています。
なお、実際には、これらの工程をAIだけで自動的に進めたわけではありません。
各フェーズで私自身がAIのアウトプットを確認し、次へ進むかどうかを判断していました。
この点については、次回詳しく取り上げます。
AIクロスレビューは「正解を探す仕組み」ではない
AIクロスレビューというと、複数のAIを使って「より正しい答え」を探す方法のように聞こえるかもしれません。
もちろん、結果としてハルシネーションやその他の誤りを発見できることはあります。
しかし、私がより重要だと感じているのは、自分の思考に揺さぶりをかけることです。
一つのAIと長く対話していると、人間とAIの間で、ある前提を共有したまま議論が進むことがあります。
話はきれいにつながっています。
だからこそ、その前提自体を疑わなくなることがあります。
そこへ別のAIを入れる。
すると、
「そもそも、この前提は正しいのでしょうか」
という、それまでとは違う視点が出てくることがあります。
そこで新しい論点に気づくことができます。
つまり、AIクロスレビューとは、単にAIに「正解」を出してもらう仕組みではありません。
異なる視点をぶつけることで、見落としていた論点を浮かび上がらせる仕組み
でもあるのです。
では、誰が判断するのか
AIクロスレビューによって、一つのAIだけでは見えなかった論点を浮かび上がらせることができます。
しかし、ここで新たな問題が生まれます。
ClaudeとGeminiの意見が違ったら、どちらを採用するのか。
AIの指摘が技術的には正しくても、顧客の事情に合わなかったらどうするのか。
そして、AIが前回と今回で違うことを言ったら、どちらを信用するのか。
実際の仕事では、こうした判断をAIだけに任せることはできません。
私自身も、今回の仕事をAIに自動で最後まで走らせたわけではありません。
各フェーズでアウトプットを確認し、
次へ進むのか、それとも止めるのか――Go / No Go
を判断していました。
では、AIオーケストレーションにおいて、人間は具体的に何を判断すべきなのでしょうか。
そして、AIがどれだけ進化しても、人間に残る仕事とは何なのでしょうか。
AIに任せる。しかし、AI任せにはしない。
次回は、「Human-in-the-Loop――AIに任せてはいけない仕事」について、実際の仕事で起きた出来事を交えながら考えてみたいと思います。
前回
AIオーケストレーション①
「AIオーケストレーションとは何か――3週間の仕事を16日間で仕上げた実践から」
次回
AIオーケストレーション③
「Human-in-the-Loop――AIに任せてはいけない仕事」