裁判書面の作成能力を徹底比較!ChatGPTとQwenの論理構成力や法的表現の違いを詳しく分析

AIが法廷文書を分析・作成する未来的な法務ワークスペースのイメージ パソコン

裁判書面の作成は、法律実務の中でも特に論理的緻密さと法的表現の正確性が求められる重要な作業です。
近年、生成AIの進化により、この分野でもChatGPTやQwenといった大規模言語モデルの活用が急速に広がっています。
しかし、これらのAIが実際にどの程度の品質で裁判書面を作成できるのか、具体的な違いは何なのか——この点について、体系的な比較分析はまだ少ないのが現状です。

本記事では、ChatGPT(GPT-4o)とQwen(Qwen2.5)の2モデルを対象に、裁判書面の作成能力を多角的に検証します。
論理構成の整合性、法的用語の適切性、事実関係の整理力、そして判例や法条の引用精度——これらの観点から徹底比較し、それぞれの強みと限界を明らかにします。

具体的には、以下の項目について分析します。

  • 訴状・答弁書・準備書面といった主要書面の構成力の違い
  • 法的表現の正確性と、誤った法解釈を生じるリスクの比較
  • 判例・条文引用におけるハルシネーション(虚偽情報の生成)の発生頻度
  • 複雑な事実関係を整理し、論理的な主張を構築する能力の差異

生成AIはあくまで補助ツールですが、その性能差を正しく理解することで、法律家や法務担当者の業務効率化に大きく貢献できます。
では、ChatGPTとQwenの裁判書面作成能力を、実際の出力例を交えながら詳しく見ていきましょう。

  1. はじめに:裁判書面作成における生成AIの可能性と限界
    1. 検証の観点と方法
  2. ChatGPTとQwenの基本性能を比較:モデル仕様と法的文書処理能力
    1. モデルアーキテクチャと学習データの違い
    2. 法的文書処理に関する基礎能力
    3. 日本語法的表現への適合性
  3. 訴状作成能力の比較:事実関係の整理から請求原因の構成まで
    1. 事実関係の整理能力
    2. 請求原因の構成力
    3. 書式と表現の実務適合性
    4. 検証結果のまとめ
  4. 論理構成力の違い:三段論法と法的三段論法の適用精度
    1. 基本的な三段論法の適用能力
    2. 複数の論点が交錯する高度な論理構成
    3. 反論への対応と論理の防御力
    4. 論理構成力の総合評価
  5. 法的表現の正確性:専門用語の使い分けと文言の適切性
    1. 専門用語の使い分け精度
    2. 慣用的な文言と法的文体
    3. 法的効果を伴う表現の危険性
    4. 表現の正確性に関する総合評価
  6. 判例・法条引用の信頼性:ハルシネーションの発生頻度と対策
    1. 法条引用の正確性検証
    2. 判例引用におけるハルシネーション
    3. ハルシネーションの発生パターンと対策
    4. 実務での対応と今後の展望
  7. 実務での使い分け:ChatGPTとQwenの最適な活用法と注意点
    1. モデル別の最適な活用シーン
    2. 実務フローへの組み込み方
    3. 注意すべきリスクと対策
    4. 今後の展望と実務家としての姿勢
  8. まとめ:裁判書面作成AIの現在地と今後の展望

はじめに:裁判書面作成における生成AIの可能性と限界

法廷で使用される書類とデジタルデバイスの組み合わせ、AI支援法務のイメージ

法律実務の現場において、裁判書面の作成は最も時間と労力を要する作業の一つです。
訴状、答弁書、準備書面、証拠説明書——これらの文書は、事実関係の正確な把握から始まり、法的根拠の精緻な検討、そして論理的な主張の構築を経て完成します。
かつては、このプロセスがすべて人の手で行われていましたが、近年の生成AIの飛躍的な進化により、そのあり方が大きく変わりつつあります。

2022年末に登場したChatGPTを皮切りに、大規模言語モデル(LLM)は驚異的な文章生成能力を獲得しました。
そして2024年には、中国のアリババが開発したQwenシリーズも急速に性能を向上させ、日本語対応モデルとして注目を集めています。
これらのAIは、日常会話から専門的な技術文書まで幅広く対応できるようになり、法律分野への応用も現実味を帯びてきました。

しかし、裁判書面の作成に生成AIを活用する際には、いくつかの重要な課題が存在します。
第一に、法的正確性の問題です。
法律文書は一つの誤った法解釈や虚偽の事実認識が、案件の成否を左右する可能性があります。
生成AIが「ハルシネーション」と呼ばれる虚偽情報を出力するリスクは、法的分野において許容できないレベルにある場合があります。
第二に、論理構成の整合性です。
裁判書面は単なる情報の羅列ではなく、主張と反論、事実と法の適用という緻密な論理構造を持つ必要があります。
第三に、個別案件への対応力です。
テンプレート的な文書は生成できても、複雑な事実関係や特殊な法的論点に対して、AIがどこまで適切に対応できるのか——これが実務上の最大の関心事といえるでしょう。

本記事では、これらの観点からChatGPT(GPT-4o)とQwen(Qwen2.5)の2モデルを徹底的に比較検証します。
単なる文章の流暢さではなく、法的表現の正確性、論理構成の整合性、判例・法条引用の信頼性——これらを実際の出力例を交えながら多角的に分析します。

検証の観点と方法

本記事での比較は、以下の4つの観点から行います。

  • 論理構成力:事実関係から法的結論に至るまでの推論過程が整合しているか
  • 法的表現の正確性:専門用語の使い分けや文言が法的実務に即しているか
  • 引用の信頼性:判例や法条の引用に虚偽や誤りがないか
  • 実務適用性:実際の法律家や法務担当者が業務で活用できるレベルか

それぞれのモデルに対し、同一の法的課題を提示し、その出力結果を法務の専門知識を持つ筆者が評価します。
なお、本記事で扱う内容はあくまで生成AIの現時点での性能評価であり、法的アドバイスを提供するものではありません。
AIの出力は必ず人間の専門家が確認し、最終的な責任は人間が負う——この原則を前提として、以下の分析を進めていきます。

では、ChatGPTとQwenの裁判書面作成能力を、具体的な検証結果とともに詳しく見ていきましょう。

ChatGPTとQwenの基本性能を比較:モデル仕様と法的文書処理能力

2つのAIモデルを比較する分析画面、法務文書処理能力の検証イメージ

裁判書面の作成能力を評価する前に、まずは両モデルの基本的な性能と特性を整理しておきましょう。
ChatGPTとQwenは、いずれも現時点で最先端の大規模言語モデルですが、その設計思想や強みには明確な違いがあります。

モデルアーキテクチャと学習データの違い

ChatGPT(GPT-4o)は、OpenAIが開発したマルチモーダル大規模言語モデルです。
2024年5月に発表されたこのモデルは、テキストだけでなく画像や音声の入出力にも対応し、推論能力と応答速度の両立を実現しています。
特に法的文書処理においては、英語圏の判例や学術論文を含む膨大な学習データが強みとなっています。
日本語対応も高度に進化しており、日本の法律用語や法的表現についても相当な知識を保持しています。

一方、Qwen(Qwen2.5)は中国のアリババ・クラウドが開発するオープンソースの大規模言語モデルです。
2024年にリリースされたQwen2.5シリーズは、最大72Bパラメータのモデルまでラインナップされており、日本語を含む多言語対応が特徴です。
オープンウェイトモデルとして公開されている点も大きな違いで、ローカル環境での運用が可能です。
中国法やアジア圏の法的文書も学習データに含まれているため、法的文書処理において独自の知識ベースを持っています。

両モデルの主な仕様を比較すると、以下のようになります。

項目 ChatGPT(GPT-4o) Qwen(Qwen2.5-72B)
開発元 OpenAI アリババ・クラウド
パラメータ数 非公開 最大720億
コンテキスト長 最大128Kトークン 最大128Kトークン
日本語対応 高度 高度
ライセンス プロプライエタリ Apache 2.0(オープン)
法的知識の強み 英米法・国際法 中国法・アジア法

法的文書処理に関する基礎能力

法的文書の作成に求められる基礎能力として、長文理解力、専門用語の把握、論理的推論力の3つが挙げられます。
まず長文理解力については、両モデルとも128Kトークンのコンテキストウィンドウを持ち、長い契約書や裁判記録を一度に処理できる能力を備えています。
ただし、実際の検証では、文脈の後半部分での精度低下——いわゆる「lost in the middle」現象——が両モデルで異なる程度に確認されています。

専門用語の把握に関しては、ChatGPTは英語圏の法的文書を多く学習しているため、英米法の用語や概念について高い精度を示します。
日本法についても六法全書や主要判例の情報は保持していますが、最新の判例や下級審の判決については知識が限定的です。
Qwenは中国法の知識が豊富ですが、日本法についてはChatGPTにやや劣る印象です。
ただし、両モデルとも「知っていること」と「正確に使えること」には差があり、単に用語を羅列するだけでなく、適切な文脈で使用できるかが重要な評価ポイントとなります。

論理的推論力は、裁判書面の作成において最も重要な能力です。
ここでは、ChatGPTが一貫して高い評価を受けています。
三段論法に基づく法的推論や、複数の前提から結論を導く過程において、論理の飛躍が少なく、整合性のある主張を構築できる傾向があります。
Qwenも基本的な論理構成は可能ですが、複雑な法的論点を扱う際に、前提と結論の接続がやや曖昧になるケースが見受けられます。

日本語法的表現への適合性

日本の裁判書面には独特の表現様式があります。
「原告は以下のとおり主張する」「右記各事実は明らかである」といった慣用的な文言や、敬語と法的専門用語が混在する文体——これらを自然に生成できるかは、実務適用性を大きく左右します。
ChatGPTは日本語の法的文書を比較的豊富に学習しており、基本的な書式や表現パターンを再現できる能力があります。
Qwenも日本語対応は進んでいますが、法的文書特有の硬質な文体や、日本の訴訟実務に特有の表現については、ChatGPTに比べてやや不自然な箇所が散見される傾向があります。

これらの基礎的な性能差を踏まえた上で、次章からは具体的な裁判書面の作成シーンにおける両モデルの能力を、実際の出力例を交えながら詳しく検証していきます。

訴状作成能力の比較:事実関係の整理から請求原因の構成まで

訴状文書の作成プロセスをAIが支援する様子、法的文書の構造化イメージ

訴状は裁判手続の出発点となる書面であり、その質が事件全体の方向性を大きく左右します。
当事者の特定、請求の趣旨、請求原因——これらの要素を正確かつ論理的に記載する能力は、生成AIの裁判書面作成力を測る上で最も基本的な指標といえるでしょう。
本章では、ChatGPTとQwenに同一の事実パターンを提示し、それぞれの訴状作成能力を多角的に検証します。

事実関係の整理能力

訴状作成の第一関門は、提示された事実を適切に整理し、法的に有意義な事実とそうでない事実を区別する能力です。
ここでは、不動産賃貸借契約に関する紛争を題材に両モデルを検証しました。
複数の口頭での合意、書面のやり取り、支払い履歴などが入り組んだ事実関係を入力し、訴状の「事実及び理由」欄を作成させたのです。

ChatGPTは、入力された事実を時系列に沿って整理しつつ、法的に重要な事実と補助的事実を明確に区分して記載しました。
例えば、賃料の支払い遅延という核心的な事実については詳細に記載し、一方で当事者間の日常的なやり取りについては簡潔にまとめるという配慮が見られました。
これは、訴状において主張の焦点を明確に保つために極めて重要な能力です。

Qwenも基本的な時系列整理は可能でしたが、すべての事実をほぼ同じ粒度で記載する傾向がありました。
結果として、訴状の「事実及び理由」欄が冗長になり、裁判官や相手方に対して主張の要点が伝わりにくくなるリスクがあります。
法的文書においては「何を主張したいのか」という核心が見失われないよう、事実の選択と強調が必要です。
この点で、ChatGPTはより実務に即した出力を示したと評価できます。

請求原因の構成力

訴状の核心は、提示された事実にどの法条を適用し、どのような法的効果を導くか——この請求原因の構成にあります。
同じ事実パターンに対し、両モデルに民法のどの条項を根拠として主張を構成させるか検証しました。

ChatGPTは、賃料支払い義務の存在(民法601条)、債務不履行による契約解除(民法541条)、損害賠償請求(民法415条)という三段階の法的構成を明確に提示しました。
各法条の要件と入力事実の対応関係を具体的に記載し、「要件該当→法的効果」という論理の流れが一貫していました。
さらに、契約解除の催告があったかどうかという実務上の重要な論点についても、入力情報に基づき適切に判断し、不足情報があれば補足するよう指示しました。

Qwenも基本的な法条の引用は可能でしたが、法条の要件と事実の対応付けがやや抽象的で、具体性に欠ける印象でした。
例えば、債務不履行の成立について「被告は賃料を支払わなかったため、債務不履行が成立する」という記述に留まり、支払い期日の到来、支払いの催告、相当の猶予期間の経過といった具体的な要件の充足についての記載が薄かったのです。
これでは、相手方の反論に対する防御力が弱く、訴状としての説得力が損なわれます。

書式と表現の実務適合性

日本の訴状には、一定の書式と慣用的な表現が存在します。
当事者の表示方法、訴訟物の価額の記載、添付書面の目録——これらの形式的要件を満たすかも重要な評価ポイントです。

ChatGPTは、東京地方裁判所の訴状様式に基づいた書式を再現し、当事者欄、請求の趣旨、請求原因、証拠方法という標準的な構成を適切に出力しました。
ただし、管轄の根拠についての記載がやや簡略化されていたり、訴訟物の価額の算定根拠が不明確だったりする点は、実務家がそのまま使用するには注意が必要です。

Qwenは書式の再現にも取り組みましたが、当事者の表示方法や訴訟物の価額の記載位置など、日本の訴訟実務の細部についてやや齟齬が見られました。
これは、学習データにおける日本の法的文書の量と質の差が反映されている可能性があります。

検証結果のまとめ

訴状作成能力を総合的に評価すると、ChatGPTがQwenをやや上回る結果となりました。
特に事実の選択と整理、法的構成の具体性という点で差が顕著です。
ただし、両モデルとも以下の点では共通して改善の余地があります。

  • 個別案件の特殊な事情への対応力は限定的
  • 最新の判例や法改正への対応は不十分
  • 訴訟戦略に応じた主張の組み換えは人間の判断が不可欠

訴状はあくまで訴訟の入口に過ぎません。
次章では、より高度な論理構成が求められる「論理構成力」の比較に移り、両モデルの推論能力を深く掘り下げていきます。

論理構成力の違い:三段論法と法的三段論法の適用精度

論理的な思考の流れを視覚化した図、法的推論の構造を表現したイメージ

裁判書面の説得力は、論理構成の緻密さに大きく依存します。
日常会話とは異なり、法的議論では大前提(法規範)、小前提(事実認定)、結論(法的効果)という三段階の構造——いわゆる法的三段論法——が基本となります。
生成AIがこの構造を正確に理解し、適用できるかどうかは、裁判書面としての品質を大きく左右します。
本章では、ChatGPTとQwenの論理構成力を、具体的な法的課題を通じて比較検証します。

基本的な三段論法の適用能力

まず、シンプルな法的三段論法の適用から検証を始めました。
例題として「甲は乙に対して100万円の金銭消費貸借契約を締結したが、乙は返済期日を経過しても返済しない。
甲は乙に対してどのような請求ができるか」という設定を両モデルに提示しました。

ChatGPTは、大前提として民法587条(金銭消費貸借)と民法415条(債務不履行による損害賠償)を挙げ、小前提として契約締結と履行期日の経過という事実を整理し、結論として返還請求権の行使と遅延損害金の請求を導き出しました。
三段階の論理の流れが明確で、各段階の接続も自然でした。
さらに、遅延損害金の利率については民法404条を引用し、商法の特例についても言及するなど、論理の深みも確保していました。

Qwenも基本的な三段論法の構造は理解していましたが、大前提として挙げた法条の選択にやや迷いが見られました。
民法587条ではなく、より一般的な債権の規定を先に挙げ、金銭消費貸借の特殊性が後付け的になる構成となりました。
論理としては誤りではありませんが、主張の焦点がぼやけやすく、読み手にとって核心が伝わりにくい印象です。

複数の論点が交錯する高度な論理構成

次に、複数の法的論点が絡み合うより高度な課題を提示しました。
具体的には、売買契約における瑕疵担保責任と債務不履行責任の併存、解除と損害賠償の関係、時効の問題——これらが同時に生じるケースを想定しています。

この検証では、両モデルの差がより顕著になりました。
ChatGPTは、まず各論点を個別に分析し、それらの相互関係を整理した上で、統合的な結論を導き出すという階層的な論理構成を採用しました。
例えば、瑕疵担保責任(民法570条)と債務不履行責任(民法415条)の競合関係については、通説・判例の立場を説明した上で、本件においてどちらがより有利な主張となるかを分析しました。
また、契約解除と損害賠償請求の併存可能性については、民法545条の規定に基づき、解除と損害賠償が両立する旨を明確に記載しました。

Qwenは個別の論点については一定の知識を示しましたが、論点間の関連性の整理がやや弱く、それぞれの論点が孤立した記述になりがちでした。
特に、瑕疵担保責任と債務不履行責任の関係については、両者の違いを説明するだけで、実務上どちらを主張すべきかという戦略的な判断までは導き出せていませんでした。
裁判書面においては、個別の法的知識の羅列ではなく、それらをどう組み合わせて最も有利な主張を構築するか——この論理の組み立て力が求められます。

反論への対応と論理の防御力

優れた裁判書面は、自らの主張を立てるだけでなく、相手方の反論を予測し、それに対する防御を構築する必要があります。
この能力も論理構成力の重要な要素です。

ChatGPTは、提示された主張に対して想定される反論を列挙し、それぞれに対する反駁を構築する能力を示しました。
例えば、契約解除を主張する場合に「解除権の消滅(民法547条)」という反論を予測し、催告の適法性や解除の意思表示の到達について補強的な主張を追加しました。
このような攻めと守めの両面を意識した論理構成は、実務家にとって大きな助けとなります。

Qwenも反論の予測は試みましたが、予測される反論がやや表面的で、核心的な争点を捉えきれていない印象でした。
結果として、反駁部分が形式的になり、実質的な説得力に欠ける構成となりました。

論理構成力の総合評価

論理構成力について総合的に評価すると、ChatGPTがQwenを明確に上回る結果となりました。
特に以下の点で差が顕著です。

  • 論理の階層性:複雑な論点を整理し、階層的に構造化する能力
  • 論点間の関連性把握:個別の法的知識を統合的に組み立てる能力
  • 反論予測と防御構築:相手方の主張を予測し、先回りする能力

ただし、両モデルともに人間の経験に基づく法的直観や、訴訟戦略全体を俯瞰する判断力には遠く及びません。
論理構成の枠組みを提示する補助ツールとしては有用ですが、最終的な判断と責任はあくまで人間が担う必要がある——この認識を前提に、次章では法的表現の正確性について検証していきます。

法的表現の正確性:専門用語の使い分けと文言の適切性

法律用語が並ぶ画面と校正マーク、法的文章の精度チェックのイメージ

論理構成が優れていても、法的表現に誤りがあれば裁判書面としての価値は大きく損なわれます。
法律文書においては、一語の違いが権利義務の範囲を変え、一つの表現の揺らぎが解釈の余地を生む可能性があります。
本章では、ChatGPTとQwenが生成する法的表現の正確性を、専門用語の使い分けと慣用的な文言の適切性という2つの観点から検証します。

専門用語の使い分け精度

日本の民法や民事訴訟法には、一見似ているようで微妙な意味の違いを持つ用語が数多く存在します。
「解除」と「解約」、「履行」と「実行」、「請求」と「訴え」——これらを正確に使い分けることは、法的表現の基本中の基本です。

ChatGPTは、これらの用語の使い分けにおいて全体的に高い精度を示しました。
例えば、契約の「解除」(民法540条以下)と「解約」(特約などに基づく合意による終了)を明確に区別し、それぞれの法的効果の違いを正しく記述しました。
また、「履行期間」と「履行猶予」、「履行遅滞」と「履行不能」といった、債務不履行に関する用語についても、それぞれの成立要件と法的効果を正確に説明していました。
さらに、「抗弁」と「防御方法」の違いや、「形成権」と「請求権」の区別など、やや専門的な用語の使い分けについても、おおむね適切でした。

Qwenも基本的な用語の使い分けは可能でしたが、やや細かいニュアンスの違いを見落とす傾向がありました。
特に、中国法と日本法で用語の意味が異なるケースでは、日本法の正確な用語法からずれることがありました。
例えば、中国法では「违约金」という概念が日本法の「違約金」とは異なる性質を持ちますが、Qwenの出力に日本法の「違約金」(民法420条)の説明が中国法の概念と混同された表現が見受けられました。
これは、多言語モデル特有の課題ともいえます。

慣用的な文言と法的文体

日本の裁判書面には、長年の実務の中で定着した慣用的な文言があります。
「原告は、被告に対し、別紙目録記載の財産を所有するものである」「右記各事実は、証拠方法として提出する書証のとおり明らかである」——これらの文言は、単なる決まり文句ではなく、法的効果や証明責任の配分と密接に関係しています。

ChatGPTは、これらの慣用的な文言を比較的豊富に学習しているようで、標準的な訴状や答弁書の文体を再現する能力が高いです。
ただし、時々、やや古い表現や、実務ではあまり使われない文言が混じることもありました。
例えば、「原告は、次のとおり主張する」という表現は一般的ですが、ChatGPTが生成した文書中に「原告、茲に次のとおり陳述する」といったやや旧式的な表現が見られるケースがありました。
これは学習データに含まれる古い判例文書の影響かもしれません。

Qwenは、日本語の法的文体について学習がやや不足している印象で、日常語と法的用語が混在した不自然な文体になることがありました。
例えば、「被告は約束を守らなかった」というような口語的な表現と、「債務不履行の責任を負う」という法的表現が同一の文脈で混在するケースです。
裁判書面においては、全体を通じた文体の統一感が求められ、この点は実務上の大きな問題となります。

法的効果を伴う表現の危険性

中でも注意が必要なのは、法的効果を直接生じさせる表現です。
「放棄する」「認める」「譲渡する」——これらの表現は、書面に記載された時点で一定の法的効果が生じる可能性があり、極めて慎重に扱う必要があります。

ChatGPTは、この点について一定の配慮を示し、法的効果を生じさせる表現を使用する際に、前提条件や制限を明記する傾向がありました。
例えば、「原告は、本件請求に関する権利を放棄するものではない」といった否定的な文言を適切に挿入し、誤った法的効果の発生を防止する配慮が見られました。

Qwenは、こうした危険な表現に対する警戒感がやや薄く、不用意に法的効果を生じさせうる表現を生成するリスクがありました。
例えば、紛争の事実関係を整理する段階で「原告は、被告の主張を認める」というような表現を生成したケースがあります。
これは、紛争の事実関係を認めるという意味では正しいかもしれませんが、法的には相手方の主張を「自認」し、証明を不要にする効果を生じさせる可能性があります。
このような表現は、実務家がそのまま使用すると重大な不利益を招く危険があります。

表現の正確性に関する総合評価

法的表現の正確性について総合的に評価すると、ChatGPTがQwenを上回る結果となりました。
特に以下の点で差が顕著です。

評価項目 ChatGPT Qwen
専門用語の使い分け ◎ ○
慣用的な文言の再現 ○ △
法的文体の統一感 ○ △
危険な表現への配慮 ○ △

ただし、ChatGPTであっても、最新の法改正や新しい判例に基づく表現の変化については必ずしも追従できていません。
また、個別の事務所や裁判所の特有の表記ルールについては、AIが自動的に対応することは困難です。
したがって、AIの出力をそのまま使用するのではなく、必ず人間の専門家が表現の正確性を最終確認する——このプロセスは不可欠です。

次章では、これまでの論理構成や表現の問題をさらに深刻化させうる、判例や法条の引用における信頼性について検証していきます。

判例・法条引用の信頼性:ハルシネーションの発生頻度と対策

判例集と六法全書が並ぶデスク、AIによる引用精度検証のイメージ

法的文書において、判例や法条の引用は主張の根拠を示す核心部分です。
しかし、生成AIが抱える最大のリスクの一つであるハルシネーション——つまり、存在しない判例や法条をでっち上げて引用してしまう現象——は、法的分野において致命的な問題となり得ます。
本章では、ChatGPTとQwenの判例・法条引用の信頼性を検証し、ハルシネーションの発生頻度とその対策について詳しく分析します。

法条引用の正確性検証

まず、基本的な法条の引用について両モデルを検証しました。
民法の主要条項——総則、債権、物権、親族・相続——から代表的な条項をランダムに抽出し、条文番号と内容の一致を確認しました。

ChatGPTは、メジャーな法条については比較的高い精度を示しました。
民法415条(債務不履行)、民法570条(瑕疵担保責任)、民法540条(解除権)など、頻繁に引用される条項については、条文番号と内容の一致率はおおむね良好でした。
しかし、ややマイナーな条項や、条文の細かな改正後の内容については、旧条文を引用するケースや、条文番号と内容がずれるケースが散見されました。
例えば、民法が2020年に改正された際、債権法関係の条文に大きな変更がありましたが、ChatGPTが旧条文を引用するケースが確認されました。

Qwenは、日本法の法条についてはChatGPTに比べて知識がやや浅く、条文番号の誤りや内容の不正確さがより頻繁に見られました。
特に、中国法と日本法で条文番号が近い領域——例えば、契約法関係——では、中国法の条文内容を日本法の条文番号と結びつけて引用するような混同が発生しました。
これは、多言語モデルが異なる法域の知識を区別する際の一般的な課題ともいえます。

判例引用におけるハルシネーション

判例の引用は、法条引用よりもさらに複雑です。
判例名、事件番号、判示事項、裁判年月日——これらの情報がすべて正確でなければなりません。
ここでは、両モデルに対し、特定の法的論点に関連する判例を列挙させるタスクを課しました。

ChatGPTは、有名判例については比較的正確に引用できる傾向がありました。
例えば、最高裁判所の重要判例——「最判昭和46年7月8日」や「最判平成8年11月12日」など——については、事件名と判示事項の概略を正確に記述できました。
しかし、やや知名度の低い下級審判例や、比較的新しい判例については、ハルシネーションの発生率が上昇しました。
具体的には、存在しない事件番号を生成したり、実在の判例名に対して誤った判示事項を記載したりするケースが確認されました。

Qwenは、判例引用においてより高いハルシネーション率を示しました。
特に、日本の判例については、ChatGPTと比較して明確に劣る結果となりました。
中国の判例や、アジア圏の判例については一定の知識を持っていますが、日本の裁判実務に特有の判例名の付け方や、判例の体系的理解については不十分です。
例えば、最高裁判所の判例と高等裁判所の判例を区別せずに引用したり、判例の要旨を実際の内容と異なるものとして生成したりするケースが目立ちました。

ハルシネーションの発生パターンと対策

両モデルのハルシネーションを分析すると、いくつかの典型的な発生パターンが見て取れます。

  • 番号の捏造:存在しない条文番号や事件番号を生成する
  • 内容の混同:実在の判例名に対して、別の判例の内容を結びつける
  • 年代の誤り:正しい判例名であっても、裁判年月日を誤って記載する
  • 法域の混同:異なる法域の法条や判例を混同して引用する

これらのハルシネーションに対する対策として、以下の方法が有効です。

  • 二次確認の徹底:AIが引用した法条や判例は、必ず公式のデータベース(e-Gov法令検索、裁判所ウェブサイト等)で確認する
  • 具体的な指示:「最新の条文を引用せよ」「判例名と事件番号、裁判年月日を併記せよ」といった具体的な指示を出す
  • 段階的な生成:条文の内容を先に生成させ、それが正しいか確認してから、判例の引用に移る
  • 信頼できる情報源の指定:「六法全書に基づいて引用せよ」など、具体的な情報源を指定する

実務での対応と今後の展望

現時点では、生成AIによる判例・法条の引用は、人間の専門家による確認なしには絶対に使用できないレベルにあります。
ChatGPTもQwenも、ハルシネーションを完全に排除することはできておらず、法的文書においては許容できないリスクを伴います。

ただし、AIを補助ツールとして活用する方法はあります。
例えば、AIに法的論点を整理させ、その論点に関連しそうな法分野や判例の方向性を示唆させる——この程度であれば、人間の専門家がその後具体的な法条や判例を調査する際の手がかりとして有用です。
また、AIに法条の内容を説明させ、その説明が正しいかを人間が確認する——このプロセス自体が、専門家の知識の再確認につながることもあります。

次章では、これまで検証してきた各能力を総合し、実務におけるChatGPTとQwenの最適な活用法と注意点について考えていきます。

実務での使い分け:ChatGPTとQwenの最適な活用法と注意点

法務担当者が複数のAIツールを使い分けるワークスペースのイメージ

これまでの章で、ChatGPTとQwenの裁判書面作成能力を多角的に検証してきました。
論理構成力、法的表現の正確性、判例・法条引用の信頼性——それぞれの観点で両モデルの強みと限界が見えてきたことと思います。
本章では、これらの検証結果を踏まえ、実務の現場でどのように両モデルを使い分け、どのような注意点を設けるべきかについて具体的に考えていきます。

モデル別の最適な活用シーン

ChatGPTとQwenは、それぞれ異なる特性を持っています。
その特性を理解した上で、適材適所で活用することが重要です。

ChatGPTは、日本法に関する知識の豊富さ、論理構成の緻密さ、法的表現の正確性という点で優位にあります。
そのため、以下のシーンでの活用が適しています。

  • 訴状・答弁書など主要裁判書面の初稿作成
  • 複雑な事実関係の整理と法的構成の立案
  • 法的三段論法に基づく主張の構築
  • 日本の慣用的な法的文体に沿った文書の作成

一方、Qwenはオープンソースモデルとしての利便性、多言語対応、ローカル環境での運用可能性という強みを持ちます。
そのため、以下のシーンでの活用が適しています。

  • インターネット接続が制限された環境での補助的な利用
  • 中国法やアジア圏の法制度に関する基礎的な調査
  • 自前のファインチューニングによる特定分野への適応
  • セキュリティ要件が厳しい環境での文書処理

ただし、Qwenを日本法の裁判書面作成に使用する場合は、ChatGPTに比べてより慎重な確認作業が必要になることを前提とすべきです。

実務フローへの組み込み方

生成AIを裁判書面の作成に活用する際、最も重要なのは「AIの出力をそのまま使用しない」という原則です。
以下のようなフローを想定すると、AIの強みを活かしつつ、リスクを最小限に抑えることができます。

まず、情報入力と指示出しの段階です。
AIに提示する事実関係は、できるだけ構造化して整理し、法的に重要な事実とそうでない事実を区別して入力します。
また、出力の形式や論理構成の方針についても具体的に指示を出すことが、質の高い出力を得るためのポイントです。

次に、AIによる初稿作成の段階です。
ここでは、ChatGPTやQwenに対し、訴状の各構成要素——当事者、請求の趣旨、請求原因、証拠方法——を個別に生成させ、それぞれの出力を確認します。
一度に全文を生成させるのではなく、セクションごとに生成させることで、各部分の精度を高めることができます。

そして、人間による確認・修正の段階です。
これが最も重要なプロセスです。
AIの出力について、以下の点を必ず確認する必要があります。

  • 法条の引用が正しいか、最新の条文か
  • 判例の引用にハルシネーションがないか
  • 論理構成に飛躍や矛盾がないか
  • 法的表現に誤りや不自然な箇所がないか
  • 個別案件の特殊な事情が適切に反映されているか

最後に、最終稿の完成と責任の所在です。
AIの出力を修正・加筆した最終稿については、作成した人間がその内容の正確性と適法性について責任を負うことになります。
AIはあくまで補助ツールであり、最終的な判断と責任は人間が担う——この認識を徹底することが不可欠です。

注意すべきリスクと対策

生成AIを法的文書作成に使用する際の主なリスクと、その対策を整理すると、以下のようになります。

リスクの種類 具体例 対策
ハルシネーション 存在しない判例の引用 全ての引用を公式データベースで確認
知識の陳腐化 旧条文の引用 最新の六法全書やe-Govで確認
論理の飛躍 前提と結論の接続が不明確 論理構成をセクションごとに検証
個別性の欠如 テンプレート的な主張 案件固有の事実を反映させる
機密情報の漏洩 依頼人の個人情報を入力 クラウド型AIへの入力を制限

特に、機密情報の取り扱いについては十分な注意が必要です。
ChatGPTのようなクラウド型サービスに、依頼人の個人情報や事件の詳細を入力することは、守秘義務に抵触する可能性があります。
機密性の高い案件については、ローカル環境で動作するQwenのようなオープンソースモデルを使用するか、AIへの入力情報を匿名化・抽象化してから利用する——このような対策が求められます。

今後の展望と実務家としての姿勢

生成AIは、法律実務のあり方を大きく変えようとしています。
しかし、現時点ではあくまで補助ツールの域を出ません。
AIが法律家の仕事を奪うのではなく、法律家がAIを使いこなすことで、より質の高いサービスを提供できる——この姿勢が今後の実務家に求められます。

ChatGPTとQwenの比較を通じて明らかになったのは、現時点の生成AIは「知的な助手」としては有用ですが、「法的判断を委ねられる存在」ではないということです。
両モデルの強みを理解し、それぞれの限界を認識した上で、人間の専門知識とAIの処理能力を組み合わせる——このハイブリッドアプローチこそが、現時点での最善の活用法といえるでしょう。

次章では、これまでの検証結果を総括し、裁判書面作成AIの現在地と今後の展望について考えていきます。

まとめ:裁判書面作成AIの現在地と今後の展望

法廷とデジタル技術が融合した未来の法務作業環境のイメージ

本記事では、ChatGPT(GPT-4o)とQwen(Qwen2.5)の2モデルを対象に、裁判書面の作成能力を論理構成力、法的表現の正確性、判例・法条引用の信頼性という3つの観点から徹底的に比較検証してきました。
検証を通じて明らかになったのは、現時点の生成AIが裁判書面作成において持つ可能性と、同時に克服すべき課題の両面です。

総合的な評価として、ChatGPTは日本法の裁判書面作成において、現時点でQwenをやや上回る性能を示しました。
特に事実関係の整理能力、法的三段論法に基づく論理構成、専門用語の使い分け精度、慣用的な法的文体の再現性——これらの点で優位性が認められます。
一方、Qwenはオープンソースモデルとしての利便性と多言語対応という強みを持ち、中国法やアジア圏の法制度に関する知識では独自の価値を提供します。
ただし、日本法の裁判書面作成という限定された領域では、現時点ではChatGPTの方が実務に即した出力を生成する傾向があります。

しかし、両モデルに共通して言えるのは、現時点では人間の専門家の確認なしには絶対に使用できないという点です。
ハルシネーションによる虚偽の判例・法条引用、論理構成の微妙な飛躍、個別案件の特殊な事情への対応不足——これらの問題は、いずれのモデルでも完全には解消されていません。
AIが生成した文書をそのまま裁判所に提出することは、依頼人に重大な不利益をもたらすリスクを伴います。

では、生成AIは法律実務に何をもたらすのでしょうか。
私が考えるに、AIの真の価値は「文章作成の代替」ではなく「知的作業の拡張」にあります。
訴状の初稿作成における時間短縮、複雑な事実関係の整理における客観的な視点の提供、法的論点の網羅的な洗い出し——これらはAIが人間の能力を補完し、拡張する領域です。
しかし、最終的な法的判断、訴訟戦略の立案、依頼人との信頼関係の構築——これらは人間にしか担えない領域であり、今後も変わることはないでしょう。

今後の技術的な展望としては、いくつかの方向性が考えられます。
まず、RAG(Retrieval-Augmented Generation)技術の法的分野への応用です。
AIが生成する内容を、信頼できる法的数据ベース——e-Gov法令検索、裁判所の判例データベース、学術論文データベースなど——と連携させることで、ハルシネーションを大幅に低減できる可能性があります。
次に、ファインチューニングの進化です。
特定の法域や専門分野の法的文書でモデルを追加学習させることで、より専門性の高い出力が期待できます。
そして、マルチエージェントシステムの発展です。
複数のAIエージェントが互いの出力を検証し合うことで、単一モデルの限界を超えた精度の向上が見込まれます。

ただし、技術の進化と並行して、法的・倫理的な議論も不可欠です。
AIが生成した法的文書の責任の所在、依頼人へのAI使用の開示義務、AIによる法的アドバイスの提供と無資格業務の境界——これらの問題については、法律家コミュニティ全体で議論を深め、一定のガイドラインを整備する必要があります。

本記事の検証結果を踏まえ、法律実務家や法務担当者への提言として、以下の3点を最後に述べておきます。

  • 生成AIは補助ツールとして積極的に活用し、業務効率化を図る
  • AIの出力は必ず人間の専門家が確認し、最終的な責任は人間が担う
  • AIの限界を正しく理解し、過信と過度な警戒の両方を避ける

技術は日々進化しています。
今日のChatGPTやQwenの性能が、明日には大きく変わっているかもしれません。
しかし、法律という人間社会の基盤を支える営みにおいて、人間の判断と倫理が中心にあること——この原則は、どんなにAIが進化しようとも揺るがないものです。
生成AIを賢く使いこなし、より質の高い法的サービスを提供する。
その姿勢こそが、これからの法律実務家に求められるものです。

コメント

タイトルとURLをコピーしました