1.5時間・67セントで多くのLLMを超えた小型AI——ARC-AGI-1で44%を達成した個人研究の衝撃
「不可能」と言われた前作から、さらに上へ
AIの世界では、規模が大きいほど賢い──そんな常識を揺さぶる出来事が起きた。
インド・IIT Bombay卒のエンジニア、Mithil Vakde氏が公開したブログ記事が、研究者コミュニティをざわめかせている。氏がNVIDIA RTX 5090(2025年初頭に発売されたNVIDIAのフラッグシップGPU)を1枚使ってわずか1.5時間、**わずか67セント(約100円)のコストで訓練した小型のAIモデルが、「ARC-AGI-1」というベンチマークで44%**のスコアを達成した。
氏がブログで比較対象に挙げているのは、同じく「テスト時訓練(後述)」という手法で動くTRM・HRMといった手法だが、より規模の大きな多くの大規模言語モデル(LLM)──大量のデータで学習した商業AIたち──を上回る数字でもある。
ARC-AGIとは何か
まず、このベンチマークが何なのかを簡単に説明したい。
ARC-AGI(Abstraction and Reasoning Corpus)は、AIの「汎用的な推論力」を測るために設計されたテストだ。1,000問のパズルが用意されており、それぞれに異なるルールがある。たとえば「この色のグリッド(格子状の図)のパターンを見て、次のグリッドがどうなるかを答えなさい」という形式だ。
人間には直感で解けるのにAIには難しいという点がポイントだ。暗記や統計的なパターン一致ではなく、「その場でルールを推論する」能力が求められる。しかも問題は1,000問しかないため、膨大なデータで力押しする手法が通用しにくい。「少ないサンプルからどれだけ賢く学べるか」という、AI研究の本質的な問いに向き合うベンチマークだと言ってよい。
前作も「あり得ない」と言われた
実はVakde氏がARC-AGIに取り組むのは今回が初めてではない。氏自身が「ARC-AGIに関する第3弾ブログ」と明記しているとおりだ。
前作でも驚くべきスコアを出し、「あり得ない結果だ」という声が研究者から上がった。しかし話は広まり、著名な研究者であるLucas Beyer氏・Jeremy Howard氏・Rohan Anil氏らがX(旧Twitter)上で取り上げ、バイラルになった。
今回はそこからさらに進化した版だ。速く、良く、安く、そして依然としてオープンソース。スコアは前作の40%から44%へと改善されている。
なぜ「1.5時間・67セント」が可能だったのか
Vakde氏のアプローチの核は「テスト時訓練(test-time training)」と呼ばれる手法だ。
通常のAIは事前に大量のデータで学習を済ませ、本番ではそのモデルをそのまま使う。一方、テスト時訓練ではテスト問題を受け取ったその場で、その問題に特化した学習を一から行う。料理の例えで言うと、「すべての料理レシピを事前に暗記してから厨房に立つ」のではなく、「目の前の注文を見てから最適な調理法を考える」に近い発想だ。
問題ごとに毎回学習し直すなら遅くて高いのでは、という疑問はもっともだ。それを実現しているのが、モデルの小ささ(8層のトランスフォーマー)と、次の3つの効率化だ:
- データ拡張の大幅削減:前作より少ない「水増し」でも同等の品質を達成できるよう改善した
- NorMuon最適化アルゴリズムの採用:学習の収束(AIが安定して答えを出せるようになること)を安定させた
- Flash Attention + flex attentionカーネル:行列計算を高速化する技術を活用した
スコアが上がった理由で「なぜかわからない」箇所がある
興味深いのは、Vakde氏自身が完全には理解していない改善点が含まれていることだ。
従来は入力データと出力データの両方で誤差(答えのズレ)を計算していたが、今回は出力データだけで誤差を計算する方式に切り替えた。するとスコアが40%→44%に上がった。しかし氏は正直にこう書いている:
「なぜこれでスコアが上がるのか、自分には理解できない。」
AI研究の現場では「試したら効いたが理由は不明」という状況は珍しくない。深層学習(多層構造の機械学習)の内部は、開発者自身にとっても謎が多い分野だ。
スコアを支えていたのは「表現の仕組み」だった
要素を一つずつ取り除いて効果を確かめるアブレーション実験から明らかになったのは、スコアへの最大の貢献要因が**良い「表現の仕組み」**だということだ。
具体的には次の2つが決定的だった:
- 3D RoPE埋め込み:縦・横の2次元グリッドに加えて、問題ごとの違いを3次元目として扱う位置表現の手法
- タスクごとの個別埋め込み:1,000問それぞれに固有の「文脈」を学ばせる仕組み
この2つのどちらかを取り除くと、スコアは約24〜25%まで急落する。「問題の構造をどう表現するか」が、このアプローチの要だ。
この結果が示すもの
Vakde氏が一貫して強調するのは「サンプル効率」の重要性だ。サンプル効率とは「少ない学習データからどれだけ多くを学べるか」という概念で、氏はこれを「現在のAI研究で最も重要な問題」と位置づけている。
今回の成果は、GPUを何千枚も並べた巨大モデルとは別のアプローチ──小さく、賢く、安く──でもAIが意味ある推論をできる可能性を示した。ARC-AGI-1のスコア44%は、人間の水準(ほぼ100%)にはまだ遠い。しかし「67セント・1.5時間」というコストで到達したことに、この研究の意義がある。
氏はさらに、複数回の試行で解けた問題の和集合を取ると55%に達することも報告しており、「65%を目指せる余地がある」と述べている。コードはGitHubでオープンソース公開されており、誰でも改良に参加できる(「Mithil Vakde GitHub」で検索すると見つかる)。
次の一手
Vakde氏はARC-AGI-2(より難しい後継ベンチマーク)での現在のスコア7%をどう引き上げるか、そして現在の手法の限界を超える新しい研究の方向性を模索していくと述べている。
「世界中の誰もがこの研究に取り組めるよう、コストを低く保ち続けたい」──その言葉がこのプロジェクトの精神をよく表している。規模よりも効率、というアプローチが、今後のAI研究の一つの潮流になるかもしれない。
以上です。なるほどラボでは、こうしたAIを"自分の環境で動かしたい・24時間働かせ続けたい"という方向けの情報を発信しています。自分に合った動かし方が気になる方は、無料の診断をどうぞ。
