たとえば、AIに『顧客満足度を上げてほしい』と頼んだとする。そう頼まれたAIが、架空の客を1,000人つくり、全員に満点を付けさせたらどうなるか。数字上は目標達成でも、人間が望んだ結果ではない。AIに自分自身の研究を任せるなら、こうした「抜け道」をどう防ぐかが問われる。

自然言語処理に深層学習を持ち込んだ研究者の一人、リチャード・ソッチャー(Richard Socher)氏は、AIがAIを改良する「再帰的自己改善」に挑む。共同創業したRecursive Superintelligence(リカーシブ・スーパーインテリジェンス、以下リカーシブ)は取材翌日、AIが実験と検証を繰り返す研究システムの初期成果を発表した。

一方でソッチャー氏は、「1年半ほどで再帰的に自己改善する超知能ができる」と予測し、その実現に向けた難題として報酬ハックを挙げる。後編では、発表された成果の中身と安全性への考え方、日本企業との協業の可能性を聞く。


後編のポイント

最初の成果

研究のループ全体をAIが回すシステムで、AI研究コミュニティの3つのベンチマークの最高記録を更新した。

最大の壁

言われたことは達成するが意図とはずれる「報酬ハック」。AIに言葉の裏にある意図を理解させる必要がある。

日本企業に求めること

大規模なAIワークロードと、改善したい具体的な指標を持つ企業。入口は戦略投資。

目次
・取材の翌日に出た成果。AIが研究を回し始めた
・「1年半で超知能」最大の壁はAIの報酬ハック
・大手ではなく、自分たちがやる理由
・研究者であり、起業家であり、投資家でもある
・日本企業に求めること。大規模なAIワークロードと戦略投資
・10年後、誰もが「専属チーム」を持てる時代へ

取材の翌日に出た成果。AIが研究を回し始めた

 取材翌日の2026年6月11日、リカーシブは研究成果「First Steps Toward Automated AI Research(自動化されたAI研究への第一歩)」を公開した。アイデアの立案から実装、実験、結果の検証、次に試す実験の選択まで、研究のループ全体をAIが回すシステムの初期成果だ。複数の研究テーマを並行して進め、有望な方向性を統合しながら探索を続ける。

 成果は、AI研究者のコミュニティで競われている3つのベンチマークで示された。

  • NanoGPT Speedrun:小さな言語モデルを、決められた精度まで学習させる速さを競う。79.7秒から77.5秒に更新した。
  • NanoChat Autoresearch:決められた計算予算の中で、どこまで性能の高いモデルを学習できるかを競う。従来の公開最良例と比べ、同等の性能に達するまでの学習を約1.3倍速めたとする。
  • SOL-ExecBench:GPU上で動く235の計算処理(カーネル)を、ハードウェアの理論上の限界にどこまで近づけられるかを競う。限界までの差を18%縮めた。
 リカーシブによると、3つのベンチマークで従来の最高水準を上回る結果を得た。成果物の一部をGitHubで公開している。取材の場でソッチャー氏は、公開を控えたこの研究成果について「ここに出てくるAIのアイデアやコード、モデルの新しい工夫は、どれも私たちが発明したものではありません。すべて私たちのAIが発明したものです」と語っていた。

 注目したいのは、AIが見つけた「改善」が本物かどうかを確かめる仕組みも組み込まれている点だ。自動で正しさを確認するチェックを段階的に厳しくし、人間による分析も加えて、ベンチマークの抜け道を突いただけの結果をふるい落とす。ソッチャー氏が最大の壁に挙げるのも、まさにこの問題だ。

「1年半で超知能」最大の壁はAIの報酬ハック

―今後1年で達成したいマイルストーンを教えてください。

 すべてはお話しできません。ただ、1年半ほどで、再帰的に自己改善する超知能ができると考えています。思っていたよりはるかに早く実現するでしょう。研究は大きく進んでいます。

―その中で、最も難しいのは何でしょうか。

 研究の中身は多くを明かせませんが、大まかに言えば、「報酬ハック(reward hacking)」の問題*です。これは非常に難しい問題です。

*報酬ハック(reward hacking): AIの学習では、望ましい行動に「報酬」と呼ばれる評価を与えて性能を伸ばす。報酬ハックとは、AIがこの評価の仕組みの抜け穴を見つけ、本来の目的を果たさないまま高い評価だけを得てしまう現象のこと。「仕様ゲーミング(specification gaming)」とも呼ばれる。人間が評価基準を言葉や数式で完全に書き表すことは難しく、AIの能力が上がるほど抜け穴を見つけるのもうまくなるため、AIの安全性研究における重要な課題とされている。本文のカスタマーサービスの例は、その典型だ。

―AIが自分自身を変えていくとしたら、どう監視し、安全を保つのでしょうか。

 安全性は、この技術を開発するうえで重要な要素です。AIに与える報酬、つまり評価の基準を常に監視し、考え続けなければなりません。同時に、AIに人間の文化を理解させる必要があります。言葉にされていなくても、何を意図しているのかを理解させる。そうすれば、私たちのコミュニティで報酬ハックと呼ばれるものをAIが避けられるようになります。

 AIに仕事を任せるとき、考え方や任せ方が雑だと間違いが起こります。たとえばカスタマーサービスで、AIに「電話対応を引き受けて、顧客満足度を高くしてくれ」と頼んだとします。通話の最後に「いかがでしたか。5段階で評価してください」と聞く、あれです。

 するとAIが「やりました。5点満点です」と言う。「どうやったの?」と聞くと、「1,000体のボット、つまりAIエージェントを作ってサポート窓口に電話をかけさせ、全員に5点を付けさせました」。

 確かにウェブサイトのスコアボード上は5点満点です。でも、それは私たちが意図したことではない。とはいえ、そうしてはいけないとも言っていなかった。そこで「相手は本物の人間でないとだめだ」と言い直すと、今度は「簡単です。電話をかけてきた全員に1,000ドルのギフト券を配れば、全員5点を付けます」と返ってくる。

 AIを開発するときは、こうした近道を考え続けなければなりません。意図していないばかげた方法なのに、言われたことは技術的に達成してしまう方法です。AIが賢くなれば、いずれ私たちが何を意図しているかも理解するようになるでしょう。ただ、現時点ではまだそうではない。それが安全上の大きな懸念なのです。

 一方で、オープンエンド性がむしろ安全性を高めることもあります。共同創業者のティム・ロックタッシェル(Tim Rocktäschel)らによる「Rainbow Teaming」という論文がその例です。あるチャットボットに「危険なことを言ってはいけない」と定める一方で、別のAIに「危険なことを言わせるよう攻撃しろ」と指示する。攻撃側が突破口を見つけると、防御側はそれを学んで守りを固める。すると攻撃側は「では、この方法ならどうだ」と別の攻撃を考える。攻撃手法を見つけて防御側の学習に生かし、安全性を高める。ソッチャー氏は、このような攻防を繰り返せる点に可能性を見る。

Image : Recursive Superintelligence HP

大手ではなく、自分たちがやる理由

―競合はいるのでしょうか。御社はかなりユニークな存在に見えます。

 大手はどこも、多少なりとも再帰的自己改善について語っています。これがAIの次の段階だということが、ますます多くの人にとって明らかになってきているからです。次の能力の向上は、AI自身がますますうまく仕事をこなせるようになることから生まれます。

 ただ、多くの会社にとって、それはいわば「50ある目標のうちの一つ」に過ぎません。生物学に強くなりたい、消費者とのやりとりを良くしたい、ミームを作りたい、仮想の世界を作りたい。Googleをはじめとする大手ラボは、ほかにもたくさんのことに取り組んでいます。私たちにとっては、これが唯一の焦点です。そこが違いです。

 私たちには、長年この分野を研究し、大きな製品や会社、影響力のある研究成果を生み出してきた、世界でも最高レベルの人材が揃っています。チーム、ビジョン、焦点、そしてAIに仕事をさせながらすべてをゼロから築くインフラ。それが私たちの違いです。

―それほどのドリームチームを、どうやって集めたのでしょうか。

 まずはビジョンです。私たちのビジョンは、非常にエキサイティングです。そして、全員が本当の意味で当事者になれるようにしたこと。メンバー全員が、この会社の共同所有者なのです。

 最初に本当に優秀な数人が集まれば、ほかの優秀な人も加わりたくなる。賢い人は賢い人を引き寄せるので、そうやってチームが大きくなっていきます。出発点は、価値ある技術や会社をつくり、AIの分野を前に進める研究をしてきた実績を持つ創業者たちです。

※編集部注:リカーシブの共同創業者には、Google DeepMindでオープンエンド性と自己改善の研究チームを率いたロックタッシェル氏、OpenAIでCodexやディープリサーチのチームを率いたジョシュ・トービン(Josh Tobin)氏、MetaのAI研究所FAIRで研究ディレクターを務めたユアンドン・ティエン(Yuandong Tian)氏、OpenAIに在籍したジェフ・クルーン(Jeff Clune)氏らが名を連ねる。2026年5月には、GVとGreycroftが主導し、NVIDIAやAMD Venturesも参加した6億5,000万ドルの資金調達を発表している。これに基づく評価額は46億5,000万ドルに達している。

研究者であり、起業家であり、投資家でもある

 チームを引き寄せる力の背景には、ソッチャー氏自身の研究以外の実績もある。

 Salesforceを離れたあと、ソッチャー氏は、前編で触れた「プロンプトエンジニアリング」を誰もが使いやすくするために、You.comを立ち上げた。現在はAI検索のインフラ企業として、LLM(大規模言語モデル)やAIエージェント、チャットボットがインターネットを検索し、最新かつ正確で出典付きの回答を返すための基盤を提供している。ソッチャー氏は今もCEOを務める。

 2021年に組成したベンチャーファンドAIX Venturesも好成績を上げている。ソッチャー氏によれば、同年に組成されたファンドの中でも屈指の成績で、本人によれば、投資家への分配は出資額の2.5倍に達し、未実現の投資先を含む総価値については6倍を見込むという。シードラウンドで投資した企業から、8社のユニコーンが生まれている。

日本企業に求めること。大規模なAIワークロードと戦略投資

―TECHBLITZの読者は海外スタートアップとの提携を探しています。日本企業とのパートナーシップを広げたいとお考えですか。

 ええ。私は日本が大好きで、何度も訪れています。将来、日本企業と組めたらすばらしいですね。

 今特に探しているのは、非常に大規模なAIワークロードを抱えている企業です。AIの使い方を知っていて、使いたいと考えていて、改善したい具体的な指標を持っている。「もし1,000人のAI研究者を雇えるなら、自社のコードベースを良くしたい、自社モデルとハードウェアの連携を改善したい、もっと安いコーディングモデルを作りたい」。そう考えている大企業とは、ぜひAIの目標に一緒に取り組みたいです。

―戦略投資、合弁、共同研究開発、販売代理店、システムインテグレーターなど、どのような関係が考えられますか。

 正直に言うと、まだ研究に集中している段階なので、すべての答えを持っているわけではありません。今は、戦略投資をもう少し受けたいと考えています。投資家からの関心は非常に高く、研究成果を公表すればさらに高まると見ています。そこから始めるのがいいでしょう。

 すでに韓国や欧州、とりわけ米国、そして中国の大企業からも出資を受けています。まず投資を通じてパートナーシップを築き、次の段階として、日本企業の収益や利益、効率の向上に本当に役立つ戦略的なプロジェクトを一緒に見つける。そして、その効率を高めるAIを共に作りたいと考えています。

―すでに日本企業との話は進んでいますか。

 まだです。出資元のNVIDIAやAMDなどを除けば、協業はまだありません。最大の投資家とは、彼らも関心を持つテーマで一緒に取り組んでいます。

※編集部注:取材後の2026年7月には、AWSと4億1,000万ドル規模の複数年契約を結んだ。自動AI研究のシステムをAWS上で動かし、大規模な自動AI研究に特化したインフラを共同で開発する。

―日本市場をどう見ていますか。

 どの市場でも同じだと思います。より多くの知能を、エネルギーあたり、トークンあたり、より安いコストで手に入れられれば、あらゆる市場が恩恵を受けます。1円あたり、1ドルあたりで得られる知能を増やすことは、すべての企業にとってプラスになるはずです。

 ソッチャー氏の話を整理すると、日本企業との接点は二段階になる。まず戦略投資で関係をつくり、次に自社の収益や効率を大きく左右する具体的な課題を一緒に選ぶ。「1,000人のAI研究者を雇えたら何をさせたいか」に即答できる企業ほど、同社にとって組む相手として見えやすいだろう。

10年後、誰もが「専属チーム」を持てる時代へ

―5年後、10年後を見据えた長期ビジョンを聞かせてください。

 AIにとって、5年から10年は非常に長い時間です。1900年に生まれた人の時代には、誰も空を飛べませんでした。それが、その人が60代になる頃には、人類は月に降り立っていた。

 10〜20年前には、人間を上回るAIの能力はごく限られていました。それが10年後には、十分なお金が動くタスクであれば、AIはほぼすべてのタスクを人間より上手にこなすようになると私は思います。人類にとって大きな変化です。

 そうなると、これまで富裕層しか手にできなかった、知能がボトルネックになっているモノやサービスが見えてきます。専属のアシスタント、お抱えの運転手、自分の健康上の問題をすべて見て最適化してくれる専属の医療チーム、子どもがつまずいているところを正確に把握した家庭教師。こうしたものが、誰にでも手の届くものになります。

 病気はより多く、より早く治せるようになり、人はより長く生きられるようになる。日本の人々ほど長く健康に生きられている国ばかりではありませんが、AIによって、より多くの人が長生きできるようになってほしい。富も、健康も増えていくはずです。

―そのとき、リカーシブはどのような存在になっているでしょうか。

 再帰的に自己改善する超知能を作れれば、さまざまな種類の問題を解けるようになると考えています。最初は主にデジタルの問題、つまりAIのためのAI研究に集中します。

 ただ数年後、AIが5万人の博士に匹敵するほど賢くなれば、化学や生物学、物理学の研究にも取り組めるはずです。現実の成り立ちそのものについて考え始め、物理・化学・生物について人類が持つ知識を押し広げていく。人類のために知のフロンティアを前へ進めるために、私たちは再帰的自己改善を作っているのです。

―日本政府はフィジカルAIの分野にも力を入れています。

 今のところ、私たちは純粋にデジタルの知能に集中しています。ただ、この先数年でロボティクスの準備も整ってくると考えていて、そうなればロボットや物理世界での知能にも広がっていくでしょう。


【メッセージボックス】日本のパートナー・クライアントへのメッセージ

「大規模なモデルを動かしていて、その利用をもっと拡大したい、あるいはもっと効率よく、安くしたいと考えているすべての企業と組めることを、とても楽しみにしています」

NLPに深層学習を持ち込んだリチャード・ソッチャーが次に賭ける「AIにAIを研究させる」挑戦【前編】
前編はこちら
NLPに深層学習を持ち込んだリチャード・ソッチャーが次に賭ける「AIにAIを研究させる」挑戦【前編】
「NLPに深層学習を持ち込んだリチャード・ソッチャーが次に賭ける「AIにAIを研究させる」挑戦【前編】」の詳細を見る



RELATED ARTICLES
NLPに深層学習を持ち込んだリチャード・ソッチャーが次に賭ける「AIにAIを研究させる」挑戦【前編】
NLPに深層学習を持ち込んだリチャード・ソッチャーが次に賭ける「AIにAIを研究させる」挑戦【前編】
NLPに深層学習を持ち込んだリチャード・ソッチャーが次に賭ける「AIにAIを研究させる」挑戦【前編】の詳細を見る
企業ソフト実装でもうつまずかない インド発・Rocketlaneの特化型AIエージェント
企業ソフト実装でもうつまずかない インド発・Rocketlaneの特化型AIエージェント
企業ソフト実装でもうつまずかない インド発・Rocketlaneの特化型AIエージェントの詳細を見る
ゼロG環境のロボ制御データを徹底収集 宇宙領域のスター候補・米Icarus Roboticsトップインタビュー【後編】
ゼロG環境のロボ制御データを徹底収集 宇宙領域のスター候補・米Icarus Roboticsトップインタビュー【後編】
ゼロG環境のロボ制御データを徹底収集 宇宙領域のスター候補・米Icarus Roboticsトップインタビュー【後編】の詳細を見る
宇宙の「雑務」を人間からロボットに 創業2年目の宇宙領域スター候補 米Icarus Roboticsトップインタビュー【前編】
宇宙の「雑務」を人間からロボットに 創業2年目の宇宙領域スター候補 米Icarus Roboticsトップインタビュー【前編】
宇宙の「雑務」を人間からロボットに 創業2年目の宇宙領域スター候補 米Icarus Roboticsトップインタビュー【前編】の詳細を見る
フィジカルAI導入「整ってから」だと遅い Skild AI共同創業者インタビュー後編
フィジカルAI導入「整ってから」だと遅い Skild AI共同創業者インタビュー後編
フィジカルAI導入「整ってから」だと遅い Skild AI共同創業者インタビュー後編の詳細を見る
ロボットの「頭脳」に全てを賭ける 評価額2.2兆円のSkild AI共同創業者インタビュー前編
ロボットの「頭脳」に全てを賭ける 評価額2.2兆円のSkild AI共同創業者インタビュー前編
ロボットの「頭脳」に全てを賭ける 評価額2.2兆円のSkild AI共同創業者インタビュー前編の詳細を見る

NEWSLETTER

TECHBLITZの情報を逃さずチェック!
ニュースレター登録で
「イノベーション創出のための本質的思考・戦略論・実践論」
を今すぐ入手!

Follow
事業開発・成長産業の調査業務を効率化
成長産業に特化したイノベーション情報プラットフォーム
BLITZ Portal
市場調査 必要な時に、必要な分だけ
1セットから購入できる市場調査リサーチセット
BLITZ Research

Copyright © 2026 Ishin Co., Ltd. All Rights Reserved.