AIを3人の異なる専門家に見立てて議論させると、一人へ質問するより深い答えが得られそうに見えます。実際、最初の数往復では異なる視点が並び、専門家ミーティングのような手応えを感じます。しかし続けていると、全員が同じ前提を受け入れ、互いの発言を丁寧に言い換えるだけになりがちです。結論が出たように見えても、反対意見が議論されたとは限りません。

私自身、ASTRUMの実験でモデルやプロンプトを変えても、AI同士の会話がループしたり早い段階で相互同意へ流れる現象を観察してきました。その中で痛感したのは、複数AIを活用するアプローチの本質は人数の多さや長いプロンプトではなく、会話の進行をコントロールするファシリテーションにあるということです。

この記事では、複数AIの議論を単なる安易な合意形成ではなく、「人間が見落としている対立点を発見し、意思決定の判断材料へ変える仕組み」として設計する方法を解説します。

AI同士の議論が同調する3つの理由

なぜ、複数のAIを戦わせても最終的に意見が同調してしまうのでしょうか。理由は次の3つに集約されます。

第一の理由は、回答の出発点が根本的に似ていることです。同じ基盤モデル、同じ指示、同じ資料を与えれば、「マーケター」「エンジニア」と役割名を分けても知識の範囲や推論の癖は強く相関します。肩書きを変えただけでは、同じ常識を別の専門用語で説明する3人になりやすいのです。

第二の理由は、会話履歴の共有です。最初の回答を全員へ見せると、後続のAIは独立して考えるのをやめ、直前の文章を前提として扱い始めます。「建設的に議論してください」という指示も、衝突を避けて相手に同意する方向へ作用することがあります。

第三の理由は、終了条件が「全員の合意」になっていることです。根拠の強さや反証の有無を検証せず全会一致で終了する設計では、早く同意するほど成功に見えます。しかし意思決定で必要なのは、気持ちよくまとまった文章ではなく「採用案がどの条件で失敗するか」を理解することです。

マルチエージェント討論は万能ではない

複数AIによるディベート構造自体には可能性があります。DuらのMultiagent Debateの研究 では、複数のモデルが回答と批判を交換することで、数学推論や事実性の課題で回答精度が向上することが示されました。異なる回答を比較し誤りを指摘させる構造には価値があります。

一方で「AIを増やせば正解へ近づく」とは言えません。Huangらの自己修正に関する研究 では、外部フィードバックのない自己修正が改善せず、条件によって悪化することも示されています。追試実験でも、生成回答数を揃えるとマルチエージェント討論が多数決生成(self-consistency)を上回らないケースが報告されています。

実務上の教訓は、討論という形式そのものに知性が宿るのではなく、独立した候補が生まれ、誤りを検証できる外部基準があり、発言が意思決定へ接続されるときに効果が期待できるということです。

肩書きではなく「対立する責任」を与える

私は、役割名を職業だけで分ける方法をあまり信用していません。全員の目的が「よい案を考えること」である限り、どれだけ役柄を分けても最終的には無難な協調へ寄るからです。代わりに必要なのは、各役へ相反する責任を与えることです。

役割割り当てる責任禁止すること
提案者最も実行可能な案を1つ出す複数案を並べて判断から逃げる
反証者提案が失敗する最強の条件を示す表面的な欠点だけを指摘する
証拠監査者客観的事実、推測、未確認を分ける新しい案を勝手に追加する
決定者採用、保留、棄却と理由を残す未解決点を合意で誤魔化す

Alex KimらのDEBATE研究 も、悪魔の代弁者(あまのじゃく役)など役割を分けた討論の有効性を報告しています。重要なのはキャラクター設定の華やかさではなく、誰が何を疑う責任を持つかです。

会話ルーターを5段階で設計する

フリートークに任せるのではなく、議論フェーズに応じて次の発言者と目的を決めるのが「会話ルーター」です。私は次の5段階で組み立てます。

  1. 独立回答を作る:提案者と反証者へ同じ問いを渡し、互いの回答を見せずに初稿を作らせる。
  2. 争点を抽出する:ルーターが一致点ではなく、前提・予測・優先順位の食い違いを最大3件に絞る。
  3. 反証を指名する:各争点について「誰が」「どの主張へ」「何の証拠で」反論するかを指定する。
  4. 証拠を監査する:引用可能な根拠、観察、推測を分け、不足情報を検索や人間確認へ戻す。
  5. 結論と未解決点を分ける:決定者は採否だけでなく、結論が変わる条件と次に確かめる項目を残す。

ルーターへ渡す最小入力は「現在の問い」「対立している前提」「次に話す役」「その発言で更新したい判断」「終了条件」の5項目です。これがあれば、会話が脱線した際も「いまの判断に必要な発言か」ですぐ軌道修正できます。

ルーターのアウトプットは長い議事録ではなく「判断表」にします。「争点」「提案」「最も強い反証」「根拠の状態」「結論が変わる条件」「次の確認担当」を一行ずつ並べます。前のターンから新しい反例や証拠が増えていなければ打ち切り、増えた場合だけ次の発言者を指名します。

評価するときも、最終回答の美しさではなく「初稿で見えなかった前提が何件見つかったか」「根拠のない主張を何件分離できたか」「人間が次に確かめる行動が決まったか」を見ます。これにより単なるおしゃべりが意思決定プロセスへ進化します。

人間が介入すべき3つの場面

進行をルーターへ任せても、人間が外れてよいわけではありません。次の3つの場面では人間が必ず介入します。

  • 1. 議論が同じ言葉の言い換えになったとき:新しい証拠や反例が増えなければ、その場で議論を止めます。
  • 2. 架空の事実(ハルシネーション)が混ざったとき:AI同士は同じ誤りを共有する危険があります。多数決ではなく公式資料や実データへ接続します。
  • 3. 価値判断が求められるとき:スピード、安全性、独自性、収益性のどれを最優先するかは事実だけでは決まりません。ここはAIに委ねず、責任を持つ人間が優先順位を宣言します。

AIを扱う技術とは、プロンプトの精密さ以上にどの対立を残し、どの瞬間に自分の思想を入れるかを決める力だと感じています。

複数AIを使わない方がよい条件

あらゆる課題に複数AIの討論が向いているわけではありません。公式ドキュメントの検索で済む疑問なら、AI同士を議論させるより一次資料を読む方が速く確実です。医療、法務、財務、セキュリティのように誤りの影響が大きい判断も、AI同士の合意を根拠にしてはいけません。

検証手段がないテーマで討論させても発言量が増えるだけです。「2巡しても争点や証拠が更新されなければ終了する」「新しい情報源や異なる評価責任を持たないAIは増やさない」という停止条件が、トークン消費と長文による錯覚を防ぎます。

よいAI会議は未解決点を消さない

複数AIを使う目的は、賛成票を増やして決断を正当化することではありません。一人では見落とす前提を表へ出し、反対意見を最も強い形で検討し、判断が変わる条件を残すことです。

まずは次の議題で、同じ会話欄に3人を並べるのをやめてみてください。初稿を独立させ、ルーターに争点を3つだけ抽出させ、提案者、反証者、証拠監査者へ順番に責任を渡す。最後に人間が「何を採用したか」だけでなく「何がまだ分からないか」を書く。

AI同士が気持ちよく同意した瞬間を完成とせず、人間が判断できる対立へ変換できた瞬間を成果とする。会話の質を決めるのは参加者の数ではなく、異論を残して次の行動へ渡す設計です。