VITALIFY.ASIA logo

ロボットに相撲を教えてみたら、ラリアット・コサックダンス・空中戦を極めた件

NVIDIA Isaac Sim上で2台のロボットに相撲を学習させた強化学習実験を紹介します。Epoch 1から100までの進化を追いながら、Isaac Simを使う理由、Sim to Real、Domain Randomizationの考え方、そしてAIがラリアット・足技・空中戦といった予想外の戦略を獲得していく過程を解説します。

ロボットに相撲を教えてみたら、ラリアット・コサックダンス・空中戦を極めた件
目次

ロボット開発にはド素人の我々がまずその「土俵に立つ」ために今出来る事は何か。

答えはひとつ。
仮想空間のロボットに相撲を取らせてみることでした。

そんな決意から、NVIDIAの物理シミュレーションプラットフォーム Isaac Sim を使い、2台のロボットによる強化学習プロジェクトを立ち上げました。

物理法則の壁、そしてAIの「勝利への貪欲な執着」が交錯した結果、土俵の上で繰り広げられたのは相撲の枠組みを超えた究極の格闘進化論でした。

今回は、前半で「なぜIsaac Simを使うのか」「Sim to Realの可能性」について触れ、後半ではEpoch 1から100までに起きた壮絶なロボットたちの進化の記録をお届けします。

まずはその動画をご覧ください。

前半:Isaac SimとSim to Realの世界

なぜNVIDIA Isaac Simなのか?

ロボットの強化学習において、現実世界(Real)で失敗を繰り返しながら学習させるのは非常にコストと時間がかかります。転倒してパーツが壊れたり、サーボモーターが焼けてしまったりするからです。

そこで登場するのが、NVIDIAのロボティクスシミュレーション環境 「NVIDIA Isaac Sim」 です。

  • 高精度な物理演算: 重力、摩擦、衝突などの物理現象を忠実に再現
  • フォトリアルな描画: RTXテクノロジーによる現実さながらのレンダリング
  • 高速な大規模並列学習: シミュレーション内の時間を現実の何十倍も加速して学習可能

これにより、数か月かかる試行錯誤をわずか数時間〜数日で終わらせることができます。

Sim to Real(シミュレーションから現実へ)の挑戦

シミュレーションで学習したAIモデルを現実のロボットに移送する技術を「Sim to Real」と呼びます。

一見簡単そうに見えますが、現実世界には「シミュレーションの計算誤差」や「意図しない摩擦・センサーのノイズ」が存在します。この違い(Sim-to-Real Gap)を埋めるために、シミュレーション側の物理パラメータ(摩擦係数やロボットの重量など)をランダムに変化させながら学習させるDomain Randomization(領域ランダム化)といった手法が使われます。

今回の相撲学習でも、過酷な物理環境に耐えうる頑丈な思考アルゴリズムの構築を目指しました。

……しかし、AIが導き出した「勝つための最適解」は、人間の想像を遥かに超える方向に進化していくことになります。

激闘の記録

ここからは、相撲学習の経過をエポック(学習回数)ごとに追いかけたドキュメントです。

Epoch 1 - 6:お見合いの時代

  • 戦況: 互いにゆっくり近づくものの、土俵中央で静止。ほぼ何もしないまま制限時間終了。
  • 解説: 初期状態のロボットたち。まだ「動く」ことすら手探り状態。「動いて自爆して負けるより、静止して様子を見るのが安全」というAI特有の極限の安全志向(お見合い)が見られました。

Epoch 7:腕はいらない

  • 戦況: ついに踏み出し始めるが、突進しても軽やかにかわされる。よく見ると、両腕を背中に折りたたんでいる
  • 解説: 少しだけ積極性が出てきた時期。ここで興味深いのは、AIが「この競技において腕は物理的な接触でバランスを崩す障害物(=邪魔)」だと判断したこと。腕を封印し、体幹だけで突進するシュールな光景が広がります。

Epoch 8 - 10:一瞬の「相撲らしさ」

  • 戦況: 突進が見事にかみ合い、正面からの押し相撲が成立!
  • 解説: 互いの力が正面からぶつかり合い、粘り勝ちで土俵外へ押し出すという、全100エポックの中で唯一「相撲」と呼べる素晴らしい期間でした。開発者としても「よしよし、順調だな」と笑みを浮かべていた時期です。……この時までは。

Epoch 11 - 14:解禁された「ラリアット」

  • 戦況: 折りたたんでいた腕が解き放たれ、勢いよく振り抜かれる。一撃必殺の「ラリアット」時代の幕開け。
  • 解説: AIは悟りました。「押すより、腕を引っかけて倒す方が早い」と。この期間は、先に鋭いラリアットを叩き込んだ側が100%勝利する暗黒の世紀末状態に突入します。

Epoch 15 - 20:足技の融合

  • 戦況: 上半身でラリアットを狙いつつ、下半身で相手の足を絡めとる高度な戦術。
  • 解説: 単純な打撃から、上下の連続攻撃へ進化。相手の体勢を崩すために足をひっかけるという、極めて高度な関節・フック戦術が自然発生しました。

Epoch 25:蹴りの支配

  • 戦況: 細かいラリアットで土俵際に追い詰め、最後は容赦ない「蹴り」で土俵外へ蹴り飛ばす。
  • 解説: 押し出しのルールを完全に理解したAI。土俵際という危険地帯に相手を追い込み、確定反撃として蹴りを選択する悪魔的なコンボ技を習得しました。

Epoch 40:カオスと限界突破

  • 戦況: 動きが超高速化。フレームレートすら追いつかず、もはや視認不可能。
  • 解説: 物理演算の限界に挑むかのような超絶ステップ。言葉での説明が不可能な「AI特有の謎の超運動」の時代に突入しました。

Epoch 50:低重心の時代

  • 戦況: 突如として姿勢を極限まで低くし始める。コサックダンスのように低い体勢のまま、テコンドーのような鋭い蹴りと、フェンシングのような精密な足捌きが交錯する。
  • 解説: 上半身への攻撃を避けるため、AIが導き出した解は「腰を下げること」でした。低重心から繰り出される高速の足技は、もはや相撲というより異種格闘技の領域です。

Epoch 100:空中戦へ

  • 戦況: 姿勢が再び上がり始めると、相手を空中高く蹴り上げる大技が主流に。
  • 解説: 最終的にAIが辿りついた究極の戦略。それは「相手を宙に浮かせれば、摩擦がゼロになり100%コントロールを奪える」という物理法則のハックでした。豪快な打ち上げ技が交錯する、シミュレーションならではの超次元バトルで今回の学習は幕を閉じました。

まとめ

相撲を教えたはずが、最終的には「空中戦を制する超次元格闘AI」へと変貌を遂げた今回の実験。

一見「失敗」のように思えるかもしれませんが、これこそが強化学習の醍醐味です。AIは人間の与えたルールの隙間を突き、常に「最も勝率の高い物理挙動」を泥臭く探索し続けます。

Isaac Simによる高精度な物理シミュレーションがあったからこそ、こうした人間には思いもよらない戦略の進化を目の当たりにすることができました。

実際の対戦の模様は、ぜひ冒頭のYouTube動画にてご覧ください。

1,000社以上の事業成長を支えた圧倒的な『スピードと柔軟性』で、御社のアイデアを最短で形にします。まずは無料で壁打ちしませんか?

ブログに戻る
ぼくはデューパー、なんでもきいてね!