モリカトロン株式会社運営「エンターテインメント×AI」の最新情報をお届けするサイトです。

TAG LIST
CG機械学習ディープラーニングCGへの扉安藤幸央GAN月刊エンタメAIニュースニューラルネットワーク河合律子NVIDIA強化学習三宅陽一郎OpenAI音楽FacebookQAスクウェア・エニックスモリカトロンAIラボインタビュー敵対的生成ネットワーク森川幸人ルールベースDeepMindキャラクターAIシナリオNFTGPT-3デバッグCEDEC2019StyleGANプロシージャル自動生成人工知能学会映画遺伝的アルゴリズムメタAI自然言語処理深層学習マイクロソフトビヘイビア・ツリー吉本幸記GoogleCEDEC2021CEDEC2020ゲームAISIGGRAPH不完全情報ゲームVRナビゲーションAI畳み込みニューラルネットワークAIと倫理アートグーグルディープフェイクGDC 2021大内孝子VFXメタバースGDC 2019マルチエージェントゲームプレイAIボードゲームNPCDALL-ECLIPロボットCNNデジタルツインモリカトロンUnityファッションHTN階層型タスクネットワークJSAI2020TensorFlowMicrosoftイベントレポートテストプレイAIアート水野勇太小説アニメーションガイスターStyleGAN2懐ゲーから辿るゲームAI技術史toioJSAI2021スポーツ研究シムピープル汎用人工知能GDC Summerバーチャルヒューマンブロックチェーン倫理AdobeアストロノーカNVIDIA Omniverseeスポーツ対話型エージェントAmazoneSportsBLUE PROTOCOLシーマンUbisoftAlphaZeroTransformerGPT-2カメラ環世界中島秀之鴫原盛之ソニーDARPAドローンシムシティAI美空ひばり手塚治虫Electronic ArtsメタデータLEFT 4 DEAD通しプレイOpenAI Five本間翔太CMピクサーBERTプラチナエッグイーサリアム作曲ビッグデータ中嶋謙互Amadeus CodeMicrosoft AzureキャリアナラティブOmniverse ReplicatorレコメンドシステムNVIDIA DRIVE SimNVIDIA Isaac Simサイバーエージェント音声認識ロボティクスPyTorchDQN眞鍋和子バンダイナムコスタジオMinecraft齊藤陽介マインクラフトお知らせチャットボットアバターサルでもわかる人工知能VAEOmniverseUbisoft La Forge自動運転車ワークショップGenvid Technologiesメタ知識表現ウォッチドッグス レギオンIGDAどうぶつしょうぎEpic Gamesジェイ・コウガミ音楽ストリーミングマシンラーニング画像生成テキスト画像生成クラウド対話エンジン斎藤由多加リトル・コンピュータ・ピープルコンピューティショナル・フォトグラフィーゴブレット・ゴブラーズ絵画AIりんなシミュレーション完全情報ゲーム坂本洋典釜屋憲彦ウェイポイントパス検索藤澤仁生物学GTC 2022画像認識GTC2022StyleCLIPDeNA長谷洋平masumi toyota宮路洋一OpenSeaGDC 2022教育TextWorldSIGGRAPH ASIADALL-E2GTC2021CycleGANNetHackフェイクニュースエージェントAIボイスアクターNVIDIA CanvasGPUALifeZork人工生命オルタナティヴ・マシンサウンドスケープMCS-AI動的連携モデルASBSマンガモーションキャプチャーぱいどんTEZUKA2020ナビゲーションメッシュ松井俊浩バンダイナムコ研究所スパーシャルAIELYZAELYZA DIGEST3D音声合成マーケティングApex LegendsELIZANinjaコンピュータRPGアップルタウン物語KELDICメロディ言語ゲームTENTUPLAYMARVEL Future FightAstroタイムラプスEgo4Dインタビューバスキア日経イノベーション・ラボ敵対的強化学習階層型強化学習GOSU Data LabWANNGOSU Voice Assistant竹内将SenpAI.GGMobalytics馬淵浩希Cygames岡島学AWS Sagemaker映像セリア・ホデント形態素解析UXAWS Lambda誤字検出認知科学ゲームデザインSentencePieceLUMINOUS ENGINELuminous Productionsパターン・ランゲージ竹村也哉ちょまどボエダ・ゴティエGOAPAdobe MAX 2021模倣学習Omniverse AvatarFPSNVIDIA Rivaマルコフ決定過程NVIDIA MegatronNVIDIA Merlinスタンフォード大学NVIDIA Metropolisパラメータ設計テニスバランス調整協調フィルタリング人狼知能テキサス大学軍事AlphaDogfight TrialsAI Messenger VoicebotエージェントシミュレーションOpenAI CodexStarCraft IIHyperStyleFuture of Life InstituteRendering with StyleIntelDisneyLAIKADisneyリサーチRotomationGauGANGauGAN2ドラゴンクエストライバルズ画像言語表現モデル不確定ゲームSIGGRAPH ASIA 2021Dota 2モンテカルロ木探索ディズニーリサーチMitsuba2ソーシャルゲームEmbeddingワイツマン科学研究所GTC2020CG衣装NVIDIA MAXINEVRファッション淡路滋ビデオ会議ArtflowグリムノーツEponymゴティエ・ボエダ音声クローニングGautier Boeda階層的クラスタリングGopheraibo合成音声JuliusSIE鑑定TPRGOxia Palusバーチャル・ヒューマン・エージェントtoio SDK for UnityArt Recognitionクーガー田中章愛Meta石井敦銭起揚NHC 2021茂谷保伯池田利夫GDMC新刊案内マーベル・シネマティック・ユニバース成沢理恵MITメディアラボMCU著作権アベンジャーズマジック・リープDigital DomainMagic Leap OneMagendaMasquerade2.0ノンファンジブルトークンDDSPフェイシャルキャプチャーサッカーモリカトロン開発者インタビュー里井大輝Kaggle宮本茂則バスケットボール山田暉Assassin’s Creed OriginsAI会話ジェネレーターSea of ThievesGEMS COMPANYmonoAI technologyLSTMモリカトロンAIソリューション初音ミクOculusコード生成AI転移学習テストAlphaCodeBaldur's Gate 3CodeforcesCandy Crush Saga自己増強型AISIGGRAPH ASIA 2020COLMAPADOPデバッギングBigGANGANverse3DMaterialGANリップシンキングRNNグランツーリスモSPORTReBeLグランツーリスモ・ソフィーGTソフィーVolvoFIAグランツーリスモチャンピオンシップRival PrakDGX A100VTuberユービーアイソフトWebcam VTuber星新一賞北尾まどかHALO市場分析将棋メタルギアソリッドVフォートナイトFSMRobloxナップサック問題Live Nation汎用言語モデルWeb3.0AIOpsSpotifyMITスマートコントラクトReplica StudioAWSamuseChitrakarQosmo巡回セールスマン問題徳井直生ジョルダン曲線メディア5GMuZero政治クラウドゲーミングRival Peakがんばれ森川君2号和田洋一リアリティ番組Stadiaジョンソン裕子MILEsNightCafeインタラクティブ・ストリーミングLuis Ruizインタラクティブ・メディアポケモンCodexシーマン人工知能研究所東京工業大学Ludo博報堂ラップSIGGRAPH 2019ArtEmisZ世代AIラッパーシステムARrinnaGROVERプラスリンクス ~キミと繋がる想い~FAIRSTCチート検出Style Transfer ConversationオンラインカジノRCPアップルRealFlowRinna Character PlatformiPhoneデジタルヒューマンDeep FluidsSoul MachinesMeInGameAmeliaAIGraphブレイン・コンピュータ・インタフェースバーチャルキャラクターBCIGateboxLearning from VideoANIMAK予期知能逢妻ヒカリセコムユクスキュルバーチャル警備システムカント損保ジャパン哲学対談上原利之ドラゴンクエストエージェントアーキテクチャアッパーグラウンドPAIROCTOPATH TRAVELER西木康智OCTOPATH TRAVELER 大陸の覇者Siemensアルスエレクトロニカ2019品質保証StyleRigAutodesk逆転オセロニアBentley Systemsワールドシミュレーター奥村エルネスト純いただきストリートH100齋藤精一大森田不可止COBOL高橋智隆DGX H100ロボユニザナックDGX SuperPOD泉幸典仁井谷正充クラウドコンピューティングロボコレ2019Instant NeRFartonomousbitGANsぎゅわんぶらあ自己中心派Azure Machine Learning意思決定モデル脱出ゲームHybrid Reward Architectureコミュニティ管理ウロチョロスSuper PhoenixSNS理化学研究所Project Malmoオンラインゲーム気候変動Project PaidiaEarth-2Project Lookoutマックス・プランク気象研究所Watch Forビョルン・スティーブンスBing気象モデルLEFT ALIVE気象シミュレーション長谷川誠ジミ・ヘンドリックス環境問題Baby Xカート・コバーンエコロジーロバート・ダウニー・Jr.エイミー・ワインハウスSDGsMagentaYouTubeダフト・パンクメモリスタSFGlenn MarshallELYZA PencilThe Age of A.I.Story2Hallucination音声変換レコメンデーションJukebox松尾豊Veap JapanEAPテンセントSIFT福井千春DCGAN医療MOBADANNCEメンタルケア人事ハーバード大学Edgar Handy研修デューク大学Netflixデータマイニングmynet.aiローグライクゲーム東京大学東京理科大学人工音声NeurIPS 2021産業技術総合研究所はこだて未来大学リザバーコンピューティングプレイ動画ヒップホップキャラクターモーションソニーマーケティングサイレント映画もじぱNBA環境音暗号通貨現代アートFUZZLEAlteration粒子群最適化法RPG進化差分法オープンワールド群知能下川大樹AIFAウィル・ライト高津芳希P2E大石真史SIGGRAPH 2022BEiTStyleGAN-NADAレベルデザインDETRゲームエンジンSporeUnreal Engineデノイズ南カリフォルニア大学Unity for Industry画像処理SentropyCPUDiscordCALMプログラミングソースコード生成GMAIシチズンデベロッパーTRPGGitHubウィザードリィMCN-AI連携モデルAI Dungeon西川善司並木幸介サムライスピリッツ森寅嘉ゼビウスSIGGRAPH 2021ストリートファイター半導体Topaz Video Enhance AI栗原聡DLSS山野辺一記NetEase大里飛鳥DynamixyzU-Net13フェイズ構造アドベンチャーゲームADVXLandAGI手塚眞DEATH STRANDING不気味の谷Eric JohnsonOculus Questコジマプロダクション生体情報デシマエンジンインディーゲーム写真高橋ミレイ照明Maxim PeterJoshua Romoffハイパースケープ山崎陽斗深層強化学習立木創太ミライ小町テスラGameGANパックマンTesla BotTesla AI Dayソサエティ5.0SIGGRAPH 2020バズグラフニュースタンテキ東芝DIB-R倉田宜典韻律射影広告韻律転移

学習の秘訣は計画性にあり。ルールの知識なしで学習するゲームプレイAI「MuZero」の到達点と可能性

2021.1.27ゲーム

学習の秘訣は計画性にあり。ルールの知識なしで学習するゲームプレイAI「MuZero」の到達点と可能性

昨年12月23日、Google傘下のAI研究機関DeepMindは画期的なゲームプレイAI「MuZero」を発表しました。同機関は、これまでにも囲碁トッププロに勝利した「AlphaGo」、学習データなしにチェス、将棋、そして囲碁でトップレベルの棋力を発揮した「AlphaZero」を発表してきました。MuZeroは、こうした同機関の研究の延長線上にあるAIです。この記事では、MuZeroの革新性とその可能性について解説します。

降雨のメカニズムを知らなくても、傘をさせば濡れない

MuZeroをはじめとするほとんどのゲームプレイAIは、強化学習という技法が使われています。従来の強化学習は、さらに先読み探索とモデルベース学習という2つの手法に分類されます。

先読み探索とは目標を達成する最善な選択肢を可能な選択肢のなかから絞り込む手法であり、AlphaZeroで採用されています。この手法はチェスのような簡単かつ明示的なルールがあるゲームの解決には有効ですが、現実世界の問題は複雑かつ不明瞭なので、この手法の応用範囲は限られます。モデルベース学習は、問題が生じる環境との相互作用から最適な行動を学習する手法です。この手法では環境を正確にモデル化する必要があるのですが、現実世界の問題はモデル化すること自体が非常に困難という欠点があります。

MuZeroは、従来の強化学習の限界を打破するAIとして開発されました。以前の限界を打破する手法として採用されたのが、「計画的な学習」です。この手法は、対処すべき問題が置かれた環境を正確にモデル化しようとはせずに、目標の達成に必要な環境の側面だけをモデル化したうえで学習するというものです。具体的には、以下のような観点から学習します。

  1. 現在の位置はどの程度よいのか(現状の評価)
  2. どのような行動を選択すべきなのか(選択肢の評価)
  3. 直近に選択した行動は、どの程度よかったのか(選択結果の評価)

以上のような学習プロセスは「現状分かっている情報にもとづいて最善を尽くす」と表現することができ、まさに人間が日々行っている問題解決アプローチだと言えます。こうした学習プロセスに関して、DeepMindの研究チームは「傘をさすことは、降雨のメカニズムを理解するモデル化よりも、濡れずに済むことに役立つ」ようなもの、と述べています。

計画的であるほど、学習効果が高い

MuZeroで採用された計画的な学習では、与えられた環境だけから学習するので学習データを用意する必要がありません。さらには目的を達成するのに役立つ環境の側面からのみ学習するため、事前にゲームのルールを知る必要すらありません。ゲームのルールが完全に分からなくても、どんな行動がゲームの勝利につながるかはゲームプレイを通じて学べます。こうした「学習データなし・ルールの知識なし」の学習こそ、MuZeroの画期的なところなのです。

ゲームのルールに関する情報が不要なMuZeroは、ゲームプレイに関してかつてないほどの汎用性を備えていると言えます。実際、チェス、将棋、囲碁をプレイしたところAlphaZeroと同等のパフォーマンスを発揮したうえに、レトロゲームのテストセットAtari57をプレイした結果、すべてのゲームでハイスコアを更新しました。

研究チームは学習における計画性が学習結果に与える影響を調べるために、計画を立案する時間を変えた複数のMuZeroを使った囲碁のプレイも実験しました。その結果、1手あたりの処理時間を10分の1秒から50秒に増やすと、レーティングが1,000以上あがりました。この上昇は、アマチュアの強豪プレイヤーがトッププロプレイヤーに昇格するのに匹敵します。

さらに計画性と学習効率の関係を調べるために、最善行動の算出に要するシミュレーション回数を変えてパックマンのクローンゲーム『Ms. Pac-Man』(1981年、バリー=ミッドウェイ)をプレイしました。すると、シミュレーション回数が増えるほど、ゲームの上達が早くなることが確認されました。

以上の実験結果から、MuZeroは計画的に学習するほど早く上達し、より強いプレイヤーになると言えます。闇雲に学ぶより計画的に学んだほうがよい結果が得られるのは、人間とAIの両方について当てはまるのです。

動画圧縮に応用?

ゲームプレイAIに関して新たなブレイクスルーをもたらしたMuZeroについて、多数の海外メディアが大きく報じました。例えばBBCの記事では同AIの論文執筆者に名を連ねているDeepMindの筆頭リサーチサイエンティストのDavid Silver氏のコメントが掲載されています。

Silver氏によると、MuZeroの現実世界への応用として新しい動画圧縮手法の発明が取り組まれています。巨大な動画プラットフォームが林立する現在において、インターネット上のトラフィックの多くの部分は動画による通信で占められています。こうした動画通信を効率的に圧縮する方法を発明できれば、通信環境の大幅な効率化が期待できます。実際、MuZeroを使った初歩的な動画圧縮実験を行ったところ、よい結果が得られた、とのこと。2021年には何らかの成果が発表できる、と同氏は語っています。

Venture BeatがMuZeroについて報じた記事では、同AIの限界について言及されています。同AIは確かにかつてない汎用性とハイパフォーマンスを実現しましたが、その実験結果はシングルプレイの完全情報ゲームをプレイした場合に限られています。それゆえ、複数のプレイヤーが外交交渉するゲームである『ディプロマシー』のようなマルチプレイ不完全情報ゲームのプレイに関しては、完全にモデル化できていないのではないか、と指摘されています。

前出のBBCの記事では、イギリス・サウサンプトン大学のコンピュータサイエンス学科教授で、イギリス政府に対してAIに関して諮問する機関「AI Council」のメンバーでもあるWendy Hall教授のコメントも掲載されています。同教授もMuZeroは「大きな前進」をもたらしたと評価するものも、DeepMindは自分たちの研究結果の意図しない結果、もっと言えば悪影響についてはあまり考察していないのではないか、と懸念を表明しています。そのうえで、AI研究開発の推進とその成果が社会に及ぼす影響に関する考察の両方にバランスよく取り組まなければならない、とも語っています。

DeepMindはゲームプレイAIやAIの自然科学への応用に関して、今後も画期的な研究成果を発表することでしょう。そうした成果を正しく評価すると同時に社会への影響を考察するのは、DeepMindのみならずAI業界の関係者全員が果たすべき責務と受け止めるべきでしょう。

参考論文:Mastering Atari, Go, chess and shogi by planning with a learned model

Writer:吉本幸記、Photo by Jon Tyson on Unsplash

RELATED ARTICLE関連記事

【CEDEC2021】ブロックチェーンゲームにおける報酬設計

2021.10.27ゲーム

【CEDEC2021】ブロックチェーンゲームにおける報酬設計

AIにも泣けるストーリーは書ける?:藤澤仁氏×森川幸人氏対談(前編)

2019.10.08ゲーム

AIにも泣けるストーリーは書ける?:藤澤仁氏×森川幸人氏対談(前編)

AI時代の死生観とアイデンティティはどこへ向かうのか?:藤澤仁氏×森川幸人氏対談(後編)

2019.10.11ゲーム

AI時代の死生観とアイデンティティはどこへ向かうのか?:藤澤仁氏×森川幸人氏対談...

RANKING注目の記事はこちら