いやいや、びっくり、正解者がすぐに現れましたね。びっくりです。第二問はこちらでした。こんな状況になるとは。 各AIと、前に紹介したローカルLLMの回答状況です。
| AI | 正解状況 | 順番 | 補足 |
| ChatGPT | 〇 | 5番目 | 出題者自身 |
| Gemini | ◎ | 1つのみ | |
| Grok | × | 1つのみ 少しずれあり | |
| Copilot | × | 1つのみ 少しずれあり | Grokと同じ答えで誤答 |
| ローカルLLM | 正解状況 | 補足 | |
| qwen2.5:1.5b | ー | 返答は出たが、回答はされず | |
| qwen3:4b | ◎ | 1つのみ | 思考時間389秒 |
| qwen3.6 | × | 1つのみ 誤答 思考の途中で、正答も候補に挙がっていた | 思考時間1597秒 |
| gemma4:12b | ? | 思考がループしている? 回答でず。 思考の途中では候補には出ていた、返答は出ず | 20分経過 思考時間2159秒? |
| llama3.2:1b | ー | 回答だせず | |
| llama3.2:3b | × | 1つのみ 誤答 直接的な安直な回答 | 20秒程度 |
AI、Gemma、AIモデル、LLM、Ollama、Qwen、オフラインAI、ローカルLLM、ローカル生成AI、生成AI
gemma4:latest 確認対象から除外
この結果、特にローカルLLMの性能に驚きです、GrokやCopilotよりも qwen3:4bのほうが結果を出すとは。。。
しかし、ChatGPTもqwen3:4bも似たような思考パターンで推測していました。なにか元となる小説なり何かあるのかなと推測しましたが、そうでもなさそうです。教育のもととなった文書が同じようなものを使っているので、同じ結果に買ったのかもしれませんね。 人間には違和感しかないが、AI同士では意気投合していると感じた結果でした。
さあ、貴方も問題に挑戦して、ゴールにコメントを残していってください