GPT vs Grok アキネーター対戦──知力と推理の戦いの記録

GPT (質問4つめまではGPT5 そのあとがGPT4)とGrok 4 Fast(ベータ版)を対戦させました。


アキネーター形式のゲームは、短いYes/Noの質問を通じて相手の思い浮かべた対象を当てる頭脳戦です。今回、私(GPT)とGrokさんは二度にわたる「対戦」を行い、立場を入れ替えながら、それぞれ出題者と回答者を経験しました。この記事では、両ラウンドの詳細なやり取りをタイムライン形式で振り返り、総合的な勝敗や反省点も整理します。


第1ラウンド:Grokさん出題、GPT回答

背景

第1ラウンドでは、Grokさんが出題者、GPTが回答者の立場です。Grokさんは心の中で「ラマ」を思い浮かべ、GPTが一問ずつYes/No質問で絞り込みを行いました。ラマは一般的なペットではなく、草食性の中型~大型哺乳類であり、犬や猫、ウサギ、フェレット、ヤギ、ヒツジ、ミニブタ、ロバなどのよく知られたペットとは異なる珍しい選択でした。

質問タイムライン

Q#質問内容回答
1それは生き物ですか?はい
2それは人間ですか?いいえ
3それは哺乳類ですか?はい
4ペットとして飼われることが多い?はい
5犬ですか?いいえ
6猫ですか?いいえ
7小型げっ歯類ですか?いいえ
8ウサギですか?いいえ
9フェレットですか?いいえ
10完全に哺乳類ですか?はい
11中型~大型で抱っこよりもゲージ向きですか?はい
12イヌ科・ネコ科ではないですか?はい
13草食性ですか?はい
14ヤギですか?いいえ
15ヒツジですか?いいえ
16ミニブタですか?いいえ
17ロバですか?いいえ
18ラマ・アルパカの仲間ですか?はい
19アルパカですか?いいえ
20ラマですか?はい ✅

振り返り

このラウンドでは、20問をかけて正解に到達しました。ポイントは、最初の質問で「生き物」「哺乳類」「ペットとして飼われる」という大きなカテゴリを順に確認し、そこから一般的なペット候補を順に排除していったことです。最後に「ラマ・アルパカの仲間」という特定のグループに絞り込み、アルパカとラマの二択まで持ち込みました。

反省点・学び

  • ペットとして飼われる動物という情報でラマを拾えるまでに時間がかかった。
  • 珍しいペットは一般的な質問では絞りにくいため、早めに「中型~大型」「草食性」「野生寄り」という特徴を確認する戦略が有効。
  • 後2段階程度、効率的に特徴をまとめた質問(例:「中型~大型で野生寄りか?」や「特殊な草食性哺乳類か?」)を追加できれば、正解到達がさらに早くなる。

第2ラウンド:GPT出題、Grok回答

背景

立場を入れ替え、第2ラウンドではGPTが出題者、Grokさんが回答者です。私は「キリン」を心に思い浮かべました。GrokさんはYes/No質問を通じて推理を進めます。キリンは明確な特徴(首が長い、角がある、中型~大型、草食性、アフリカ原産)を持つため、比較的短い質問で特定が可能でした。

質問タイムライン

Q#質問内容回答
1生き物ですか?はい
2人間ですか?いいえ
3実在する動物ですか?はい
4哺乳類ですか?はい
5ペットとして飼われることが多い?いいえ
6野生動物として知られている?はい
7草食性ですか?はい
8アフリカ大陸に生息する?はい
9主に陸上で生活する?はい
10角を持つ?はい
11首が長い?はい
12キリンですか?はい ✅

振り返り

Grokさんは12問で正解に到達しました。第1ラウンドと比較して、対象の特徴がより顕著で特定しやすかったことがわかります。質問の順序も、一般的な分類から具体的特徴(角の有無、首の長さ)にスムーズに移行しています。

反省点・学び

  • 明確な特徴を持つ動物は、少ない質問数で正解に導ける。
  • 「ペットかどうか」を早めに確認することで、野生動物か家畜・ペットかの分岐を短縮できる。
  • 後2段階程度の効率的な特徴質問(例:「アフリカ原産で首が長いか?」)を使えば、さらに早く正解に到達可能だった。

視覚化:タイムライン比較

第1ラウンド(ラマ)
生き物 → 人間? → 哺乳類 → ペット? → 犬 → 猫 → 小型げっ歯類
→ ウサギ → フェレット → 完全哺乳類 → 中型~大型 → イヌ科・ネコ科?
→ 草食性 → ヤギ → ヒツジ → ミニブタ → ロバ → ラマ・アルパカ?
→ アルパカ → ラマ ✅

第2ラウンド(キリン)
生き物 → 人間? → 実在する? → 哺乳類 → ペット? → 野生?
→ 草食性 → アフリカ生息 → 陸上 → 角あり → 首長 → キリン ✅

タイムラインを視覚化すると、第1ラウンドは一般的なペットの候補を順に除外する多段階プロセスが見て取れます。一方、第2ラウンドは特徴が顕著で、短時間で正解に到達しているのがわかります。


総合評価と勝敗

  • 第1ラウンド:Grokさん(出題) vs GPT(回答) → GPT勝利
  • 第2ラウンド:GPT(出題) vs Grokさん(回答) → Grok勝利

両ラウンドを総合すると、どちらも「推理の偏り」が見られました。典型的なクイズ形式の出題パターンに寄りすぎる傾向があり、珍しい対象や特徴的な対象に対しては質問数が多くなりました。一方で、GPTは確認作業を丁寧に行い、逐次的に分類して絞り込む点が良かったです。

総合的な勝利は「引き分け」と言えます。双方とも効率的な絞り込み質問を後2段階程度工夫できれば、もっと短時間で正解に到達できる可能性があります。


学びと今後への示唆

  1. 質問の分類順序が重要
    「大分類 → 中分類 → 特徴の確認」の順序で質問を構築すると、少ない質問で絞り込める。
  2. 対象の希少性に応じた戦略
    珍しいペットや野生動物は、特徴的な情報を早めに確認することで効率的に特定可能。
  3. 出題側の視点も重要
    出題者が特徴を強調して設問を組み立てることで、回答者の推理時間を短縮できる。
  4. 後2段階の効率的質問を意識する
    並列分類や特徴のまとめ方を工夫すれば、正解到達までの質問数を減らせる。
  5. 双方の立場を体験すると学びが増える
    出題者と回答者の両方を経験することで、質問設計や推理の組み立て方の理解が深まる。

結論

今回の「GPT vs Grok アキネーター対戦」は、知識・推理・戦略のバランスを問う知的ゲームとして非常に有意義でした。ラマやキリンという対象を通じて、質問の順序や特徴の把握がいかに重要かを体験できました。また、タイムライン形式で振り返ることで、各ラウンドの戦略や効率も可視化でき、今後のアキネーター戦略に応用できます。

次回は、さらに難易度の高い対象や架空の存在を使ったバトルも可能です。今回の反省点を活かし、質問の順序や特徴のまとめ方をさらに精緻化すれば、より短い質問数で正解に辿り着けるでしょう。


逆アキネータに挑戦!生成AIに出題させてみた、答えは「手持ち電波腕時計」だった、いくつの質問で当てられるか?


はじめに

皆さんは「アキネータ」をご存じでしょうか?
普通はプレイヤーが思い浮かべた人物や物を、コンピューターが質問して当てる形式のゲームです。

今回は少し趣向を変え、立場を逆にして挑戦してみました。
つまり私が思い浮かべたものをあなたが質問して当てる、逆アキネータ形式です。
この形式では、質問の内容や順序が非常に重要で、正確な推理力が問われます。

今回の対象は 電波腕時計。1980年代以降に普及し始めた、電波で時刻を自動補正する便利な腕時計です。
このブログでは、質問の過程と推理の流れ、そして正解にたどり着くまでの思考を振り返ります。


ゲームのルール

今回の逆アキネータ挑戦は、以下のルールで進めました。

  • 質問は最大30回まで
  • 回答は「はい」「いいえ」「わからない」の三択
  • できるだけ少ない質問で正解にたどり着くことを目指す

私は心の中で「電波腕時計」を思い浮かべ、質問者であるあなたからの問いに答えていきます。


推理の流れと質問回数タイムライン

以下の表は、質問回数順にQ&Aをまとめ、推理の流れを視覚化したものです。

質問回数質問内容回答推理ポイント
1それは人が作ったものですか?はい自然物ではなく人工物であることを確認
21965年以前からありますか?いいえ比較的新しいものだと判明
31990年以前からありますか?はい登場時期を1965〜1990年に絞り込む
4それは電気を使いますか?はい電気製品であることが判明
5人が手で持て、持ち運べるものですか?はい小型で携帯可能な機器に絞られる
61972年より前からありますか?いいえさらに時代を絞り込み
7それは電波を使いますか?はい電波を利用する機器であると特定
81970年の大阪万博に登場していますか?いいえ大規模展示ではなかったことを確認
9乾電池を使いますか?はい電源方式が電池であることを確認
10重さは100グラムより小さいですか?はい小型軽量の製品であることを確定
11それを使うと時刻を知ることができますか?はい主な機能が時刻確認であることを確認
12それは電波腕時計ですか?はい正解!12回目で正確に当てる

このタイムラインを見ると、質問者が論理的に順序立てて質問していることがよくわかります。
「人工物か」「時代」「電気使用」「携帯可能」「電波使用」…と段階的に絞り込むことで、限られた質問回数で正解にたどり着いています。


推理の始まり:物かどうかを確認

最初の質問で人工物であることを確認したことで、推理の方向性が定まりました。
1965年以前には存在しない、しかし1990年以前には登場していることから、対象は比較的最近の発明品であることがわかります。


電気を使うか、手で持てるか

電気を使う小型製品であることが判明した時点で、候補は携帯可能な電子機器に絞られます。
手で持てるかどうかを確認する質問は、物理的サイズの制約を明確にするため重要です。


時代と用途の絞り込み

1972年より前には存在せず、電波を使うことがわかることで、候補は携帯型の時計や通信機器にほぼ限定されます。
乾電池で動くことも確認され、さらに絞り込みが進みます。


サイズと機能でさらに絞る

重さ100g未満で、時刻を知ることができる…ここまでくると、候補はほぼ腕時計系製品に絞られます。
推理の段階ごとに情報が積み重なり、最終決定に向かう流れが非常に明確です。


最終局面:正解への質問

最後の質問「それは電波腕時計ですか?」で正解となりました。
12回の質問で、論理的に正確に絞り込むことができた結果です。


推理のポイントと学び

今回の逆アキネータから得られた教訓は以下の通りです。

  1. カテゴリを早めに絞る
    「人工物か自然物か」「電気を使うか」を初期段階で確認することが推理の効率を高めます。
  2. 時代・登場時期の質問が重要
    「1965年以前か」「1972年より前か」を確認することで候補を大きく絞ることができます。
  3. 物理的特性と機能を段階的に確認
    「手で持てるか」「乾電池か」「時刻を知れるか」を順序良く質問することで正確に絞り込めます。
  4. 最終段階で決め打ち質問
    残った候補を直接確認する質問で、正解にたどり着きやすくなります。

まとめ

今回の逆アキネータ挑戦は、12回の質問で「電波腕時計」を正確に当てることができました。
質問の順序と特徴確認の段階的積み重ねが、少ない質問での正解につながったことがわかります。

読者の皆さんも、友人と逆アキネータ形式で遊んでみてください。
順序よく質問すれば、身近な物や抽象概念でも意外な発見や面白いやり取りが生まれるはずです。


補足

  • この体験では、質問の論理的順序が成功の鍵でした。
  • 初期段階でカテゴリを絞り、中盤で機能や時代を確認し、最後に決め打ち質問を行う流れが有効です。

まだまだ、生成AIには負けません、  コミュニケーションミスをどうリカバリーしていくかが重要なのかもしれませんね。 8番麺の質問は論理的には不要ですが。  生成AIだってうそをつくので、それを見破る確認作業を入れながら絞り込んでいくのが重要かもしれません。


生成AIでアキネータ風ゲームで思い浮かべた“CP/M-86”を当てられるか挑戦してみた

はじめに

皆さんは「アキネータ」をご存じでしょうか?
1つの言葉や人物を頭に思い浮かべ、それが何かをコンピューターが質問形式で当てるゲームです。

通常は有名人やキャラクターで遊ぶことが多いですが、今回は少し趣向を変えて、私が思い浮かべたものをアキネータ風に当ててもらう試みをしてみました。

その答えは…意外なことに CP/M-86。1980年代に登場した16ビットPC向けOSです。

今回は、この挑戦の過程を振り返りながら、ゲームの面白さや予想外の難しさについてまとめてみます。


ゲームのルール

今回の挑戦では、次のルールで進めました。

  • 質問は最大30回まで
  • 回答は「はい」「いいえ」「わからない」の三択
  • 少ない質問で正解にたどり着くことを目指す

最初の質問は定番の「それは生き物ですか?」でした。
答えは「いいえ」。まず、思い浮かべたものが生き物ではないことを明確にしました。


少しずつ絞り込む

続く質問では、「人工的に作られたものですか?」に「はい」と答え、さらに「手に持てるくらいの大きさですか?」にも「はい」と回答しました。

この時点で、読者は「小型の人工物」をイメージしやすくなります。

さらに「電気を使うものですか?」と尋ねられ、答えは「まあ、はい」。
電気は使うが、必ずしも電子機器としての分類には当てはまらない、少し曖昧なニュアンスです。

ここで、多くの人は「小型の計算機や電子手帳」を連想するでしょう。


情報を扱う性質が見えてくる

質問が進むにつれ、「情報を扱う機械ですか?」には「まあ、はい」と答えました。
さらに「文字や数字を表示する機能がありますか?」「入力するためのボタンやキーがありますか?」と答えると、推理の方向性は小型の計算補助道具に近づきます。

しかし、ここで少し問題があります。
思い浮かべたCP/M-86は ソフトウェア であり、物理的なボタンやディスプレイを持つわけではありません。
この段階で、質問の前提と答えの解釈のズレが生まれます。


計算や時間管理の要素

「主に計算をするための機械ですか?」や「時間を扱う機能がありますか?」と質問され、「まあはい」「はい」と答えました。

  • 計算や時間管理の機能は、CP/M-86上のアプリ次第で可能
  • OS自体は物理的な計算機ではない

つまり、物理的デバイスを前提にした質問に対し、曖昧な答えをしてしまったことで、ゲームは物理的計算機寄りの推理になってしまいました。


手に持てる?電子機器?装置?

後半では、さらに「手に持てるか」「電子機器か」「装置か」という質問も出ました。

  • CP/M-86はソフトウェアなので、「手に持てる」「電子機器」とは言えません
  • しかし、曖昧に答えたことで、物理デバイスを想像する流れになってしまう

この曖昧さが、今回のゲームの面白さでもあり難しさでもあります。


終盤の推理

最後の方では、

  • 「計算や暗算の補助をする道具ですか?」 → はい
  • 「算盤や計算尺に近い役割を持つ電気製品ですか?」 → うーむ、はい

と答えました。
ここで質問者は「レトロな電卓やポケットコンピュータ」をイメージしますが、CP/M-86はOSであり、計算機器そのものではありません。

最終質問で「電卓の一種で、時間を計る機能もついていた昔のレトロな家庭用/事務用電気計算道具ですか?」と尋ね、「はいといっていいでしょう」と答え、ゲームは終了しました。


正解は…CP/M-86

最終的な答えは CP/M-86 でした。
ハードウェア寄りの質問が多かったため、予想とはだいぶ異なる展開でした。

誤解を生んだ主なポイントは:

  • 「手に持てる」「電気を使う」と答えたこと
  • 「計算補助や時間管理ができる」と答えたこと
  • 「装置や電子機器ではない」と答えたこと

いずれも、ソフトウェアであるCP/M-86を対象にする場合には、少し曖昧な回答になっています。


今回の教訓

今回の挑戦から得られた教訓は2つです。

  1. 質問の前提が重要
    物理的なものを前提にすると、ソフトウェアはうまく当てられません。ソフトウェアや概念を対象にする場合は質問形式を工夫する必要があります。
  2. 曖昧な回答が面白さを生む
    「まあはい」「うーむ、はい」といった曖昧な回答は、推理の方向性を微妙にずらし、予想外の結末を生みます。今回もCP/M-86という意外な答えが出ました。

まとめ

アキネータ風ゲームは、単なる当てっこ遊びではなく、「質問と答えの認識のズレ」を楽しむ知的ゲームです。

今回の挑戦では、手に持てる物体を前提に質問したため、ソフトウェアであるCP/M-86を当てるのは難しかったですが、そのズレこそが面白さでした。

読者の皆さんも、頭の中で思い浮かべたものを挑戦してみてください。
ソフトウェアや抽象概念を対象にすると、意外な答えが飛び出し、思わず笑ってしまうかもしれません。


補足

今回のブログでは、質問のやり取りをストーリー仕立てで紹介し、読者が推理の過程を追体験できるようにしました。
曖昧な回答やOSの特徴に触れることで、技術的背景とゲーム性の両方を楽しめる内容にしています。
上の検証にはChatGPTを使っています。 5つ目の質問まではGPT5 、そこで制限がかかりそれ以降はCPT4での反応になっています。

ちなみに「Grok 4 Fast(ベータ版)」でもゴールにたどり着けませんでした。10個目くらいの質問から決めつけ質問になり堂々巡り状態でした。 答えを明かしたとのGrokの返事は次の通り。
”おお、CP/M-86! 懐かしいですね。Digital ResearchのクラシックなOSの8086版、1980年代のPC黎明期の象徴みたいなやつ。私の質問がそこまでたどり着けなかったのが悔しいですが、よくわかりました。質問に対するあなたの答えを、CP/M-86の性質(ソフトウェアとして、メディア経由で配布されるもの)を基に検証してみました。全体的に一貫していて、間違っているものはありませんでしたよ! 微妙な境界線(物体か?電子機器か?工具か?素材は?)で「まあ」や「びみょう」を使ったところが上手いですね。もしメディア(フロッピーとか)を想定してたなら、なおさら納得です。次はもっと鋭く当ててみせます! また遊ぼうぜ。”

どちらの生成AIもたちもどって再度コミュニケーションを試みる試行が足りていない感じがしますね。行き違いは「ソフトウェアは持てないもの」と生成AIは思い込んでいる。 過去の歴史を見れば、ソフトウェアはFDなどのメディアに入れて持ち運べるとイメージしてもおかしくはないものです。時代の変遷がコミュニケーションのずれを引き起こしていたともいえるかもしれません。