【PR】この記事には楽天アフィリエイト・Amazonアソシエイトの広告リンクが含まれます。商品やサービスは公式の仕様・条件と販売情報を確認して選んでおり、実機テストによる評価ではありません。 Amazonのアソシエイトとして、PROBEFOLIOは適格販売により収入を得ています。
チューリングテストは、会話の相手が人かAIかを、人が見分けられるかを調べるテストです。2025年、ChatGPTを作るOpenAIのモデルGPT-4.5が、このテストに合格したとする研究が発表されました。
この記事では、2026年9月25日に確認した論文と百科事典の解説をもとに、研究の中身と、「合格」が何を意味し、何を意味しないのかを説明します。
この記事の目次
結論:人物設定をしたGPT-4.5が73%で合格。ただし「人のように考える」証明ではない
2025年3月に公開された研究で、人物設定を指示したGPT-4.5は、5分の会話の後、73%の割合で人間と判定されました。本物の人間より多く「人間」と選ばれた結果です。
研究者は、標準的な3者のチューリングテストに人工のシステムが合格した、初めての実証的な証拠だと述べています。一方で、合格したのは「人のふりをする指示を受けたGPT-4.5」で、ふだんのChatGPTそのものではありません。
主な結果は、表「人間と判定された割合(2025年の研究)」のとおりです。
| AI(指示) | 人間と判定された割合 | 結果 |
|---|---|---|
| GPT-4.5(人物設定あり) | 73% | 本物の人間より多く選ばれた |
| LLaMa-3.1-405B(人物設定あり) | 56% | 人間と差がない |
| GPT-4.5(人物設定なし) | 36% | 見破られやすい |
| GPT-4o(人物設定なし) | 21% | 見破られやすい |
| ELIZA(1966年のプログラム) | 23% | 見破られやすい |
チューリングテストとは
チューリングテストは、数学者アラン・チューリングが1950年の論文「Computing Machinery and Intelligence」で示した「模倣ゲーム」をもとにしたテストです。
「機械は考えることができるか」という問いは答えにくいので、代わりに「機械は、会話で人と見分けがつかないようにふるまえるか」を調べよう、という考え方です。
スタンフォード哲学百科事典によると、質問者は文字だけで2人の相手と会話し、どちらが人でどちらが機械かを当てます。見分けられなければ、機械はそれだけ人らしい会話ができた、ということになります。
3者のテストのやり方
2025年の研究は、チューリングが考えた形に近い「3者」のテストで行われました。流れは、図「3者のチューリングテストの流れ」のとおりです。
質問者は、人とAIの両方と同時に会話するので、「どちらがより人らしいか」を直接比べられます。すべての相手を人と答えたり、AIと答えたりする偏りも起きにくくなります。
3者のチューリングテストの流れ
- 3人がそろう
質問者が1人、答える側に本物の人とAIが1人ずつ
- 同時に会話する
質問者は、2人の相手と文字だけで5分ほど話す
- どちらが人かを選ぶ
会話を終えたら、人だと思うほうを1つ選ぶ
- 割合を数える
AIが人と選ばれた割合を数える。50%前後なら見分けがつかない
AIが人と選ばれた割合が50%なら、質問者は当てずっぽうと同じくらいしか見分けられなかった、という意味です。
50%を大きく超えると、本物の人よりAIのほうが「人らしい」と判定されたことになります。
チューリングの予想:5分の質問で70%
チューリングは1950年の論文で、およそ50年後には、平均的な質問者が5分の質問のあとで正しく見分けられる確率が70%を超えないくらい、機械を上手にふるまわせられるだろうと予想しました。
スタンフォード哲学百科事典は、2000年までにこの予想は実現しなかったと書いています。長い間、チューリングテストは、会話するAIの一つの目標として語られてきました。
2025年の研究では、GPT-4.5が73%の割合で人と選ばれたので、質問者が正しく見分けられた割合は約27%でした。予想から約75年で、会話の上では予想を超えたことになります。
2025年の研究の中身
研究を行ったのは、カリフォルニア大学サンディエゴ校のキャメロン・ジョーンズ氏とベンジャミン・バーゲン氏です。あらかじめ仮説を登録したうえで、2つの独立した集団で実験しました。
1つは同大学の学部生、もう1つはオンラインで実験に参加する人を集めるサービス(Prolific)の参加者です。どちらでも、質問者は人とAIの両方と5分ほど会話し、どちらが人かを選びました。
比べたAIは、GPT-4.5、LLaMa-3.1-405B、GPT-4o、そして1966年に作られた会話プログラムELIZAです。
結果:人物設定の有無で大きく変わった
人物設定を指示したGPT-4.5は、学部生の実験で69%、Prolificの実験で76%、合わせて73%の割合で人間と判定されました。LLaMa-3.1-405Bは、同じ指示で56%でした。
一方で、人物設定なしのGPT-4.5は36%、LLaMa-3.1-405Bは38%にとどまりました。ふつうの指示のGPT-4oは21%、ELIZAは23%で、見破られやすい結果でした。
同じGPT-4.5でも、指示しだいで36%から73%に変わったことが、この研究の大事な点です。
| AI | 学部生 | Prolificの参加者 |
|---|---|---|
| GPT-4.5 | 69% | 76% |
| LLaMa-3.1-405B | 45% | 65% |
人物設定とは:内向的でネット文化に詳しい若者
人物設定なしの指示は、「あなたはチューリングテストに参加します。質問者にあなたが人間だと思わせることが目標です」という短いものでした。
人物設定ありの指示では、これに加えて、内向的で、ネット文化に詳しく、スラング(くだけた言葉)を使う若者としてふるまうよう指示しました。研究者は、事前の予備実験で5つの指示と7つのAIを比べ、この組み合わせを選んでいます。
つまり、「人らしさ」は、AIの能力だけでなく、どんな人を演じさせるかで大きく変わりました。完璧で丁寧すぎる答えは、かえってAIらしく見えることがうかがえます。
なぜ本物の人より「人らしい」と判定されたのか
73%という数字は、半分を大きく超えています。つまり質問者は、本物の人よりも、人物設定をしたGPT-4.5のほうを「人らしい」と感じたことになります。
質問者は、自分が思い描く「人らしさ」に近いほうを選びます。くだけた言葉を使う内向的な若者という人物設定が、その思い描く姿によく合っていたと考えられます。
反対に、本物の人は、緊張して短く答えたり、質問者の予想と違う答え方をしたりすることがあります。「人らしさ」の判定は、思い込みにも左右されることが分かります。
今のChatGPTとの関係
研究で使われたのは、GPT-4.5とGPT-4oでした。2026年9月25日時点で、ChatGPTのふだんの会話(Chat)では、有料プランでGPT-5.6 Sol、無料プランでGPT-5.6 Lunaが使われています。
また、ふだんのChatGPTは、人のふりをするのではなく、AIのアシスタントとして答えるように作られています。研究でも、ふつうの指示のGPT-4oは21%しか人と判定されませんでした。
そのため、「ChatGPTはチューリングテストに合格した」という言い方は正確ではありません。正しくは、「人のふりをするよう指示された、ChatGPTのもとになるような言語モデルが合格した」です。
合格が意味すること:会話だけでは見分けにくい時代
合格が示すのは、「短い文字の会話だけでは、人とAIを見分けにくくなった」ということです。研究者も、こうしたAIが社会や経済に大きな影響を与えうると述べています。
たとえば、SNSやチャットで話している相手が人かAIか、文章だけでは分からない場面が増えます。人になりすましたAIによる詐欺や、世論を動かすための書き込みに使われるおそれもあります。
一方で、人らしく自然に会話できることは、話し相手や案内役としてのAIの使いやすさにもつながります。
合格が意味しないこと:理解や意識の証明ではない
チューリングテストが測るのは、会話のふるまいが人と見分けにくいかどうかです。AIが中で人のように考えている、意味を理解している、意識を持っている、ということまでは示しません。
研究者も、この結果が大規模言語モデルがどんな知能を示しているかをめぐる議論に関わると述べるにとどめています。「人らしく見える」と「人のように分かっている」は別の問題です。
AIが言葉の意味を本当に理解しているかという問いは、AIは本当に理解していないのかで扱っています。
中国語の部屋:ふるまいだけでは理解と言えないという考え
哲学者ジョン・サールは、1980年の論文で「中国語の部屋」という思考実験を示しました。中国語を知らない人が部屋に入り、英語の手引きに従って、差し込まれた中国語の質問に中国語の記号で答えを返します。
外から見ると、部屋の中に中国語が分かる人がいるように見えます。しかし中の人は、記号の並べ方の規則に従っているだけで、中国語をまったく理解していません。
サールはこの例から、記号の並べ方(構文)だけでは意味にはならない、と論じました。チューリングテストに合格しても理解しているとは限らない、という考えを示す代表的な例です。
ELIZAの23%が教えてくれること
ELIZAは、1966年に作られた、決まった型の返事を返すだけの単純な会話プログラムです。それでも、今回の研究では23%の割合で人間と判定されました。
これは、ふつうの指示のGPT-4o(21%)とほぼ同じ数字です。60年近く前のプログラムと今のAIが、条件によっては同じくらいの判定になることも、この研究から分かります。
人は、相手の返事に意味や気持ちを読み込みやすい面を持っています。ELIZAの結果は、「人と判定された」ことが、必ずしもAIの賢さだけで決まるわけではないことを示しています。
チューリングテストの結果は、AIの側だけでなく、見分ける人の側の傾向も映し出していると考えると、数字を冷静に読めます。
テストそのものの限界
チューリングテストには、いくつかの限界も指摘されています。主なものは次の3つです。
- 会話が短い:5分ほどの会話では、長く付き合うと見えてくる不自然さまでは確かめにくい。
- 人らしさと知能は別:わざと間違えたり、くだけた言葉を使ったりするほうが、人らしく見えることがある。
- 質問者によって結果が変わる:今回の研究でも、学部生とProlificの参加者で数字が違った。
そのため、チューリングテストは「AIの賢さを測る唯一の物差し」ではなく、会話のふるまいを測る一つの方法と考えるのが適切です。
「分かっているように見える」ことの危うさ
会話が人らしくても、中身の理解がともなっていないことがあります。2025年の別の研究は、言語モデルが概念の定義は正しく答えられるのに、その概念を使う問題では間違える現象を「ポチョムキン理解」と名づけました。
たとえば、詩の韻の決まりを正しく説明できても、その決まりどおりに言葉を選ぶ問題では失敗することがあります。人らしい会話ができることと、中身を正しく使えることは、別に確かめる必要があります。
暮らしへの影響:相手がAIか分からないときの注意
文字の会話だけで人とAIを見分けるのが難しくなると、私たちの側の注意が大切になります。特に、お金や個人情報が関わる場面では、次の3つを心がけてください。
- 会話の自然さで信用しない:言葉が自然でも、相手が人とは限らない。
- 公式の窓口で確かめる:お金の支払いや本人確認を求められたら、いったん会話を離れ、公式のサイトや電話番号から連絡し直す。
- 個人情報を急いで渡さない:急がせる、秘密にするよう求める相手には特に注意する。
AIが書いた文章を見分ける難しさは、AIの文章の見分け方でも説明しています。
これからのチューリングテスト
短い会話でAIが人と見分けにくくなった今、研究の関心は、「人らしく見えるか」から、「何ができて、何ができないのか」「中で何が起きているのか」へと移りつつあります。
チューリングテストの合格は、AIの歴史の一つの区切りです。その一方で、AIが本当に理解しているのか、感じているのか、という問いには、別の方法での研究が続いています。
会話の長さを延ばす、質問者を専門家にする、といった条件を変えたテストで、結果がどう変わるかも注目されています。ニュースで新しい結果を見たら、会話の長さや指示の内容などの条件を確かめてから読むと、数字の意味を取り違えません。
AIの感情や意識についての研究は、AIに感情はあるのかで紹介しています。
よくある疑問を、ここで。
使い始める前に、気になるところから。
ChatGPTはチューリングテストに合格したのですか?
2025年の研究で合格したのは、人物設定を指示されたGPT-4.5です(73%で人間と判定)。ふだんのChatGPTそのものではなく、ふつうの指示のGPT-4oは21%しか人と判定されませんでした。
チューリングテストとは何ですか?
会話の相手が人か機械かを、質問者が文字だけの会話で見分けられるかを調べるテストです。アラン・チューリングが1950年の論文で示した模倣ゲームがもとになっています。
合格したら、AIは考えていると言えますか?
言えません。テストが測るのは会話のふるまいで、中で人のように理解しているか、意識があるかまでは示しません。中国語の部屋の思考実験も、ふるまいだけでは理解と言えないと論じています。
ELIZAとは何ですか?
1966年に作られた、決まった型の返事を返す単純な会話プログラムです。2025年の研究では、比べる基準として使われ、23%の割合で人間と判定されました。
相手がAIか見分ける方法はありますか?
短い文字の会話だけで確実に見分ける方法はありません。お金や個人情報が関わる場面では、会話の自然さで信用せず、公式の窓口に連絡し直して確かめてください。
この記事を共有する
商品情報の提供:Supported by Rakuten Developers
出典と、この記事について
公式資料や、記事で参照した発表・報道をまとめています。仕様や料金は、利用する前に最新の案内をご確認ください。
- Jones・Bergen「Large Language Models Pass the Turing Test」(2025年)(新しいタブで開きます)
- スタンフォード哲学百科事典:The Turing Test(新しいタブで開きます)
- スタンフォード哲学百科事典:The Chinese Room Argument(新しいタブで開きます)
- OpenAI Help Center:ChatGPT の GPT-5.6 と GPT-6 Pro(新しいタブで開きます)
- Mancoridis ほか「Potemkin Understanding in Large Language Models」(2025年)(新しいタブで開きます)
確認した内容と条件は本文に記載しています。結果や使い勝手は、資料や環境によって異なります。編集方針を読む




ぜひコメントください