本文へ移動する

AIの成績くらべ。各社のいちばん賢いAIを、3つの物差しで並べました

川登が片手を腰に当て、もう片方の手で指し棒を持って、イーゼルの上の横棒グラフを指している。グラフには青、オレンジ、緑の長さの違う棒が並んでいる

いま、いちばん賢いAIはどれなのか。

AIの会社の分け方を調べたついでに、各社のいちばん上のAIの成績も並べてみました。 AIの成績を測っている第三者のサイト3つから数字を集めて、グラフにしています。

結果から言うと、上位はアメリカの3社。 そのすぐ下に、中国の会社が並んでいます。

📏 3つの物差しで比べました

AIの「賢さ」は、ひとつの点数では決まりません。 なので、測り方の違う3つの物差しを使いました。

  • ① 総合点:Artificial Analysis というサイトが、10種類のテスト(作業の代行・プログラミング・理系の推論など)をまとめた点数
  • ② とても難しい試験:専門家が作った難問の試験「Humanity's Last Exam」の正答率。検索などの道具は使わずに解いたもの
  • ③ 人の投票:LMArena というサイトで、同じ質問への2つの答えを人が見比べて、良いほうに投票した結果の点数

各社1本ずつ、いちばん成績のよいモデルを選んでいます。 グラフの色は国で、青はアメリカ、オレンジは中国、緑はヨーロッパの会社です。

📊 ① 総合点

総合点の横棒グラフ。高い順に、Anthropic の Claude Opus 5.5 が57.6、OpenAI の GPT-6 Astra が52.7、Google の Gemini 4 Argon が52.6、Meta の Muse Spark 1.3 が48.1、SpaceXAI の Grok 4.7 が46.5(ここまでアメリカの会社)。続いて中国の Alibaba の Qwen3.8 Max が45.4、Z.ai の GLM-5.3 が44.8、Moonshot AI の Kimi K3 が43.6、DeepSeek V4.1 Flash が39.5、ヨーロッパの Mistral Large 4 が38.4、中国の MiniMax-M3 が29.2、Tencent の Hy3 が25.3

1位は Anthropic の Claude Opus 5.5。 2位以下の OpenAI と Google はほぼ同点で、そのあとに Meta、Grok と続きます。

中国の会社では、Qwen(Alibaba)、GLM(Z.ai)、Kimi(Moonshot AI)が上位です。 トップとの差は、12〜14点ほどです。

出典:Artificial Analysis Intelligence Index v4.3.2(英語)(2026年10月8日に取得)

🧠 ② とても難しい試験

とても難しい試験の正答率の横棒グラフ。高い順に、Anthropic の Claude Opus 5.5 が61.4%、Google の Gemini 4 Argon が57.1%、OpenAI の GPT-6 Astra が54.7%、Meta の Muse Spark 1.3 が48.7%、中国の Moonshot AI の Kimi K3 が46.9%、SpaceXAI の Grok 4.7 が43.1%、中国の Alibaba の Qwen3.8 Max が43.1%、Z.ai の GLM-5.3 が42.3%、DeepSeek V4 Pro が41.0%、MiniMax-M3 が39.0%、ヨーロッパの Mistral Large 4 が35.0%

人間の専門家でも難しい問題です。 いちばん上でも正答率は6割ほど。まだ全部は解けないんですね。

順位は総合点とほぼ同じですが、中国の Kimi K3 が少し上がって5位に入っています。

出典:Artificial Analysis による測定(英語)(文字だけの2,158問、2026年10月8日に取得)

🗳️ ③ 人の投票

人の投票の点数を、誤差の幅の線つきの点で表したグラフ。高い順に、Google の Gemini 4 Argon が1525、Anthropic の Claude Opus 5.5 が1504、Meta の Muse Spark 1.3 が1494、中国の Moonshot AI の Kimi K3 が1488、OpenAI の GPT-6.1 Sol が1483、Alibaba の Qwen3.8 Max が1482、Z.ai の GLM-5.3 が1479、DeepSeek V4.1 Flash が1474、Baidu の ERNIE 5.1 が1468、ByteDance の Seed 2.0 Pro が1457、Tencent の Hy3 が1456、SpaceXAI の Grok 4.7 が1443、MiniMax-M3 が1440、ヨーロッパの Mistral Medium 3.5 が1427

これは「人がどっちの答えを好んだか」の点数です。 点数の差が小さいので、棒ではなく点で表しています。 横の線は誤差の幅で、線が重なっていれば、ほぼ同じくらいと見てください。

ここでは、中国の Kimi K3 が OpenAI より上に来ています。 一方で Grok は、総合点に比べて順位が下がっています。 試験の点数と、人が使って「いいな」と思うかは、少し別なんですね。

出典:LMArena Text(英語)(投票の締め 2026年10月2日、文体の影響を補正した標準の表示)

📋 表で見る

順位会社(モデル)国総合点難問の試験人の投票
1Anthropic
Claude Opus 5.5
米国57.661.4%1504
2OpenAI
GPT-6 Astra
米国52.754.7%1483
GPT-6.1 Sol
3Google
Gemini 4 Argon
米国52.657.1%1525
4Meta
Muse Spark 1.3
米国48.148.7%1494
5SpaceXAI
Grok 4.7
米国46.543.1%1443
6Alibaba
Qwen3.8 Max
中国45.443.1%1482
7Z.ai
GLM-5.3
中国44.842.3%1479
8Moonshot AI
Kimi K3
中国43.646.9%1488
9DeepSeek
DeepSeek V4.1 Flash
中国39.541.0%
DeepSeek V4 Pro
1474
10Mistral
Mistral Large 4
欧州38.435.0%1427
Mistral Medium 3.5
11MiniMax
MiniMax-M3
中国29.239.0%1440
12Tencent
Hy3
中国25.3―1456
―Baidu
ERNIE 5.1
中国――1468
―ByteDance
Seed 2.0 Pro
中国――1457

順位は総合点の順です。太字は、それぞれの列のいちばん上。 数字の下の小さい文字は、その列だけ別のモデルの数字を使っているときの名前です。

⚠️ 見るときの注意

  • とわラボ調べ:各サイトが公開している数字を、とわラボが2026年10月8日に集めて、1社1本に選んで並べたものです。サイトの公式のランキングそのものではありません
  • グラフどうしは比べない:3つの物差しは目盛りがまったく違います
  • 設定で変わる:同じモデルでも、考える強さの設定で数点変わります
  • まだ使えないモデルもある:Gemini 4 Argon は今は一部の相手だけ、Mistral Large 4 は試験提供(プレビュー)です
  • 選び方:各社の1本は、値段ではなく点数でいちばん上のモデルです。たとえば Anthropic は、値段が上の Fable 5.1 より Opus 5.5 のほうが、どの物差しでも上でした
  • 日本のモデル:PLaMo や tsuzumi などは、どのランキングにも載っていなかったので入っていません
  • すぐ変わる:新しいモデルが出ると、順位はすぐに入れ替わります

まとめると: 2026年10月時点では、Anthropic・OpenAI・Google のアメリカ3社が上位で、そのすぐ下に中国の会社が並んでいます。人の投票では中国の Kimi K3 が OpenAI より上になるなど、物差しによって順位は少しずつ変わります。

💬 今日のひとこと

並べてみて思ったのは、上位の差が思ったより小さいことでした。 総合点の1位と2位で5点、人の投票では誤差の幅が重なっている会社がたくさんあります。

ふだん使うぶんには、どれを選んでも大きな差はない、と言ってもいいくらいです。 それより、使いやすいアプリか、無料でどこまで使えるか、のほうが大事かもしれません。

日本のモデルが1つも載っていなかったのは、ちょっとさみしいところ。 載ったら、また並べてみます。

AIを仕事に入れてみたい方へ。 とわラボでは、AIの使い方のご相談や、AIを使ったWEBアプリづくりを承っています。お問い合わせはこちら

ほかの記事

記事の一覧へ