モリカトロン株式会社運営「エンターテインメント×AI」の最新情報をお届けするサイトです。

TAG LIST
CGCGへの扉安藤幸央機械学習月刊エンタメAIニュースディープラーニング河合律子生成AI吉本幸記OpenAIGAN音楽NVIDIAGoogle三宅陽一郎強化学習ニューラルネットワークStable DiffusionChatGPTグーグル森川幸人シナリオDeepMindQA大規模言語モデル人工知能学会GPT-3自然言語処理マイクロソフトFacebook大内孝子AIと倫理映画著作権アート倫理キャラクターAI敵対的生成ネットワークルールベースLLMSIGGRAPHモリカトロンゲームプレイAIスクウェア・エニックスモリカトロンAIラボインタビュー画像生成NPCNFTプロシージャルMidjourneyデバッグMinecraftDALL-E2StyleGAN遺伝的アルゴリズム画像生成AIロボットファッション音楽生成AI自動生成VFXAdobeテストプレイメタAIアニメーションテキスト画像生成深層学習CEDEC2019ディープフェイクデジタルツインメタバースVR小説ボードゲームDALL-ECLIPビヘイビア・ツリーマンガCEDEC2021CEDEC2020ゲームAI不完全情報ゲームナビゲーションAI畳み込みニューラルネットワークGDC 2021JSAI2022バーチャルヒューマン作曲MicrosoftNVIDIA OmniverseGDC 2019マルチエージェントCEDEC2022MetaマインクラフトAIアート3DCGStability AIメタデジタルヒューマン懐ゲーから辿るゲームAI技術史toioジェネレーティブAIスポーツエージェントプロンプト栗原聡手塚治虫汎用人工知能CNNNeRFDALL-E 3BERTロボティクスUnityOmniverseJSAI2023鴫原盛之HTN階層型タスクネットワークソニーGPT-4マルチモーダルJSAI2020GTC20233DTensorFlowインタビューブロックチェーンイベントレポート対話型エージェントAmazonメディアアートDQN水野勇太アバターUbisoftGenvid TechnologiesガイスターStyleGAN2ARELSIGTC2022教育SIGGRAPH ASIANetflixJSAI2021東京大学はこだて未来大学Bard研究シムピープルMCS-AI動的連携モデルRed RamモーションキャプチャーTEZUKA2020CEDEC2023テキスト生成インディーゲームElectronic Arts音声合成マーケティングメタデータGDC Summerイーロン・マスクStable Diffusion XLCMMicrosoft Azureアストロノーカキャリア模倣学習動画生成AIeスポーツスタンフォード大学アーケードゲームテニスサイバーエージェントトレーディングカード音声認識類家利直eSportsBLUE PROTOCOLシーマンaibo合成音声チャットボットブラック・ジャックEpic GamesAWS徳井直生クラウド斎藤由多加AlphaZeroTransformerGPT-2rinnaAIりんなカメラ環世界中島秀之PaLM哲学ベリサーブPlayable!GPT-3.5ハリウッド理化学研究所Gen-1SFテキスト画像生成AI松尾豊データマイニング現代アートDARPAドローンシムシティゲームエンジンImagenZorkバイアスマーダーミステリーASBSぱいどんアドベンチャーゲームAI美空ひばりAGI手塚眞バンダイナムコ研究所スパーシャルAIELYZANEDOFSM-DNNLEFT 4 DEAD通しプレイ論文OpenAI Five本間翔太馬淵浩希Cygames森山和道Audio2Faceピクサープラチナエッグイーサリアム効果音ボエダ・ゴティエビッグデータ中嶋謙互Amadeus Codeデータ分析MILENVIDIA ACEナラティブNVIDIA RivaOmniverse ReplicatorWCCFレコメンドシステムNVIDIA DRIVE SimWORLD CLUB Champion FootballNVIDIA Isaac Simセガ柏田知大軍事田邊雅彦トレカMax CooperGPTDisneyFireflyPyTorchChatGPT4眞鍋和子バンダイナムコスタジオAI Frog Interactive新清士大澤博隆SFプロトタイピング齊藤陽介お知らせMagic Leap OneTencentモリカトロン開発者インタビュー宮本茂則バスケットボールGeminiTikToktext-to-imageサルでもわかる人工知能text-to-3DVAEDreamFusionTEZUKA2023リップシンキングRNNUbisoft La Forge自動運転車ワークショップ知識表現ウォッチドッグス レギオンVTuberIGDA立教大学秋期GTC2022市場分析フォートナイトどうぶつしょうぎRobloxジェイ・コウガミ音楽ストリーミングMITAIロボ「迷キュー」に挑戦野々下裕子Adobe MAXマシンラーニング村井源5GMuZeroRival Peakpixivオムロン サイニックエックスGPTs電気通信大学対話エンジン稲葉通将ポケモン3Dスキャン橋本敦史リトル・コンピュータ・ピープルCodexシーマン人工知能研究所コンピューティショナル・フォトグラフィーPreferred Networksゴブレット・ゴブラーズ絵画3D Gaussian SplattingMicrosoft DesignerアップルイラストシミュレーションSoul Machines柿沼太一完全情報ゲームバーチャルキャラクター坂本洋典釜屋憲彦GitHub CopilotウェイポイントLLaMAパス検索対談藤澤仁生物学GTC 2022xAIApple Vision Pro画像認識SiemensストライキStyleCLIPDeNA長谷洋平クラウドコンピューティングmasumi toyotaIBM宮路洋一OpenSeaGDC 2022SNSTextWorldSoraEarth-2BingMagentaYouTube音声生成AIELYZA PencilScenarioSIGGRAPH2023AIピカソGTC2021AI素材.comCycleGANテンセントAndreessen HorowitzAIQVE ONENetHackキャラクターモーションControlNet音源分離NBAフェイクニュースユニバーサルミュージックRPG法律Web3SIGGRAPH 2022世界モデルレベルデザインDreamerV3AIボイスアクターUnreal Engine南カリフォルニア大学NVIDIA CanvasGPUALife人工生命オルタナティヴ・マシンサウンドスケープLaMDATRPGマジック:ザ・ギャザリングAI Dungeonゲーム背景アパレル不気味の谷ナビゲーションメッシュデザイン高橋ミレイ深層強化学習松原仁松井俊浩武田英明フルコトELYZA DIGEST建築広告西成活裕ハイブリッドアーキテクチャApex LegendsELIZA群衆マネジメントライブポートレイトNinjaコンピュータRPGライブビジネスWonder StudioAdobe Max 2023アップルタウン物語新型コロナ土木MindAgentKELDIC周済涛BIMBing Chatメロディ言語清田陽司インフラBing Image CreatorゲームTENTUPLAYサイバネティックスMARVEL Future FightAstro人工知能史Amazon BedrockAssistant with BardタイムラプスEgo4DAI哲学マップThe Arcadeバスキア星新一X.AISearch Generative Experience日経イノベーション・ラボStyleGAN-XLX Corp.Dynalang敵対的強化学習StyleGAN3TwitterVLE-CE階層型強化学習GOSU Data LabGANimatorXホールディングスWANNGOSU Voice AssistantVoLux-GANMagiAI Act竹内将SenpAI.GGProjected GANEUMobalyticsSelf-Distilled StyleGANSDXLArs ElectronicaニューラルレンダリングRTFKTAI規制岡島学AWS SagemakerPLATONIKE欧州委員会映像セリア・ホデント形態素解析frame.ioClone X欧州議会UXAWS LambdaFoodly村上隆欧州理事会誤字検出MusicLM認知科学中川友紀子Digital MarkAudioLMゲームデザインSentencePieceアールティSnapchatMusicCapsLUMINOUS ENGINEクリエイターコミュニティAudioCraftLuminous ProductionsBlenderBot 3バーチャルペットパターン・ランゲージ竹村也哉Meta AINVIDIA NeMo ServiceMubertちょまどマーク・ザッカーバーグヴァネッサ・ローザMubert RenderGOAPWACULVanessa A RosaGen-2Adobe MAX 2021陶芸Runway AI Film Festival自動翻訳Play.htPreViz音声AIAIライティングLiDARCharacter-LLMOmniverse AvatarAIのべりすとPolycam復旦大学FPSQuillBotdeforumChat-Haruhi-Suzumiyaマルコフ決定過程NVIDIA MegatronCopysmith涼宮ハルヒNVIDIA MerlinJasperハーベストEmu VideoNVIDIA MetropolisForGamesNianticパラメータ設計ゲームマーケットペリドットバランス調整岡野翔太Dream Track協調フィルタリング郡山喜彦Music AI Tools人狼知能テキサス大学ジェフリー・ヒントンLyriaGoogle I/O 2023Yahoo!知恵袋AlphaDogfight TrialsAI Messenger VoicebotGoogle I/OインタラクティブプロンプトAIエージェントシミュレーションOpenAI Codex武蔵野美術大学慶應義塾大学StarCraft IIHyperStyleBingAI石渡正人Future of Life InstituteRendering with Style手塚プロダクションIntel林海象LAIKADisneyリサーチヴィトゲンシュタインPhotoshop古川善規RotomationGauGAN論理哲学論考Lightroom大規模再構成モデルGauGAN2京都芸術大学CanvaLRMドラゴンクエストライバルズ画像言語表現モデルObjaverse不確定ゲームSIGGRAPH ASIA 2021PromptBaseBOOTHMVImgNetDota 2モンテカルロ木探索ディズニーリサーチpixivFANBOXOne-2-3-45Mitsuba2バンダイナムコネクサス虎の穴3DガウシアンスプラッティングソーシャルゲームEmbeddingワイツマン科学研究所ユーザーレビューFantiaワンショット3D生成技術GTC2020CG衣装mimicとらのあな高橋力斗NVIDIA MAXINEVRファッションBaidu集英社FGDC淡路滋ビデオ会議ArtflowERNIE-ViLG少年ジャンプ+Future Game Development ConferenceグリムノーツEponym古文書ComicCopilot佐々木瞬ゴティエ・ボエダ音声クローニング凸版印刷コミコパヒストリアGautier Boeda階層的クラスタリングGopherAI-OCRゲームマスター画像判定Inowrld AIJuliusSIE鑑定ラベル付けMODAniqueTPRGOxia PalusGhostwriter中村太一バーチャル・ヒューマン・エージェントtoio SDK for UnityArt RecognitionSkyrimエグゼリオクーガー田中章愛実況パワフルサッカースカイリムCopilot石井敦銭起揚NHC 2021桃太郎電鉄RPGツクールMZComfyUI茂谷保伯池田利夫桃鉄ChatGPT_APIMZserial experiments lainGDMC新刊案内パワサカダンジョンズ&ドラゴンズAI lainマーベル・シネマティック・ユニバースコナミデジタルエンタテインメントOracle RPGPCG成沢理恵MITメディアラボMCU岩倉宏介深津貴之PCGRLアベンジャーズPPOxVASynthDungeons&Dragonsマジック・リープDigital DomainMachine Learning Project CanvasLaser-NVビートルズMagendaMasquerade2.0国立情報学研究所ザ・ビートルズ: Get BackノンファンジブルトークンDDSPフェイシャルキャプチャー石川冬樹MERFDemucsサッカースパコンAlibaba音楽編集ソフト里井大輝KaggleスーパーコンピュータVQRFAdobe Audition山田暉松岡 聡nvdiffreciZotopeAssassin’s Creed OriginsAI会話ジェネレーターTSUBAME 1.0NeRFMeshingRX10Sea of ThievesTSUBAME 2.0LERFMoisesGEMS COMPANYmonoAI technologyLSTMABCIマスタリングモリカトロンAIソリューション富岳レベルファイブ初音ミクOculusコード生成AISociety 5.0リアム・ギャラガーSuno AI転移学習テストAlphaCode夏の電脳甲子園グライムスKaKa CreationBaldur's Gate 3Codeforces座談会BoomyVOICEVOXCandy Crush Saga自己増強型AIジョン・レジェンドGenie AISIGGRAPH ASIA 2020COLMAPザ・ウィークエンドSIGGRAPH Asia 2023ADOPNVIDIA GET3DドレイクC·ASEデバッギングBigGANGANverse3DFLAREMaterialGANダンスグランツーリスモSPORTAI絵師エッジワークスMagicAnimateReBeLグランツーリスモ・ソフィーUGC日本音楽作家団体協議会Animate AnyoneGTソフィーPGCFCAインテリジェントコンピュータ研究所VolvoFIAグランツーリスモチャンピオンシップVoiceboxアリババNovelAIさくらインターネットDreaMovingRival PrakDGX A100NovelAI DiffusionVISCUITぷよぷよScratchユービーアイソフトWebcam VTuberモーションデータスクラッチ星新一賞大阪公立大学ビスケット北尾まどかHALOポーズ推定TCGプログラミング教育将棋メタルギアソリッドVメッシュ生成KLabFSMメルセデス・ベンツQRコードVALL-EMagic Leap囲碁Deepdub.aiナップサック問題Live NationEpyllionデンソーAUDIOGEN汎用言語モデルWeb3.0マシュー・ボールデンソーウェーブEvoke MusicAIOpsムーアの法則原昌宏AutoFoleySpotifyスマートコントラクト日本機械学会Colourlab.AiReplica Studioロボティクス・メカトロニクス講演会ディズニーamuseChitrakarQosmoAdobe MAX 2022トヨタ自動車Largo.ai巡回セールスマン問題かんばん方式Cinelyticジョルダン曲線メディアAdobe ResearchTaskade政治Galacticaプロット生成Pika.artクラウドゲーミングがんばれ森川君2号AI Filmmaking Assistant和田洋一リアリティ番組映像解析FastGANStadiaジョンソン裕子セキュリティ4コママンガAI ScreenwriterMILEsNightCafe東芝デジタルソリューションズ芥川賞インタラクティブ・ストリーミングLuis RuizSATLYS 映像解析AI文学インタラクティブ・メディア恋愛PFN 3D ScanElevenLabsタップル東京工業大学HeyGenAbema TVLudo博報堂After EffectsNECラップPFN 4D Scan絵本木村屋SIGGRAPH 2019ArtEmisZ世代DreamUp出版GPT StoreAIラッパーシステムDeviantArtAmmaar Reshi生成AIチェッカーWaifu DiffusionStoriesユーザーローカルGROVERプラスリンクス ~キミと繋がる想い~元素法典StoryBird九段理江FAIRSTCNovel AIVersed東京都同情塔チート検出Style Transfer ConversationOpen AIProlificDreamerオンラインカジノRCPUnity Sentis4Dオブジェクト生成モデルRealFlowRinna Character PlatformUnity MuseAlign Your GaussiansiPhoneCALACaleb WardAYGDeep Fluids宮田龍MAV3DMeInGameAmelia清河幸子ファーウェイAIGraphブレイン・コンピュータ・インタフェース西中美和4D Gaussian SplattingBCIGateboxアフォーダンス安野貴博4D-GSLearning from VideoANIMAKPaLM-SayCan斧田小夜Glaze予期知能逢妻ヒカリ宮本道人WebGlazeセコムLLaMA 2NightShadeユクスキュルバーチャル警備システムCode as PoliciesSpawningカント損保ジャパンCaPHugging FaceHave I Been Trained?CM3leonFortnite上原利之Stable DoodleUnreal Editor For FortniteドラゴンクエストエージェントアーキテクチャアッパーグラウンドコリジョンチェックT2I-AdapterXRPAIROCTOPATH TRAVELER西木康智VolumetricsOCTOPATH TRAVELER 大陸の覇者山口情報芸術センター[YCAM]AIワールドジェネレーターアルスエレクトロニカ2019品質保証YCAM日本マネジメント総合研究所Rosebud AI GamemakerStyleRigAutodeskアンラーニング・ランゲージVoyagerLayer逆転オセロニアBentley Systemsカイル・マクドナルドLily Hughes-RobinsonCharisma.aiワールドシミュレーターローレン・リー・マッカーシーColossal Cave AdventureGDC 2024奥村エルネスト純いただきストリートH100鎖国[Walled Garden]​​プロジェクトAdventureGPT調査齋藤精一大森田不可止COBOLSIGGRAPH ASIA 2022リリー・ヒューズ=ロビンソンMeta Quest高橋智隆DGX H100VToonifyBabyAGIIPロボユニザナックDGX SuperPODControlVAEGPT-3.5 Turbo泉幸典仁井谷正充変分オートエンコーダーカーリング強いAIロボコレ2019Instant NeRFフォトグラメトリウィンブルドン弱いAIartonomous回帰型ニューラルネットワークbitGANsDeepJoin戦術分析ぎゅわんぶらあ自己中心派Azure Machine LearningAzure OpenAI Serviceパフォーマンス測定Lumiere意思決定モデル脱出ゲームDeepLIoTUNetHybrid Reward Architectureコミュニティ管理DeepL WriteProFitXImageFXウロチョロスSuper PhoenixWatsonxMusicFXProject MalmoオンラインゲームAthleticaTextFX気候変動コーチングProject Paidiaシンギュラリティ北見工業大学KeyframerProject Lookoutマックス・プランク気象研究所レイ・カーツワイル北見カーリングホールAppleWatch Forビョルン・スティーブンスヴァーナー・ヴィンジ画像解析Gemini 1.5気象モデルRunway ResearchじりつくんAI StudioLEFT ALIVE気象シミュレーションMake-A-VideoNTT SportictVertex AI長谷川誠ジミ・ヘンドリックス環境問題PhenakiAIカメラChat with RTXBaby Xカート・コバーンエコロジーDreamixSTADIUM TUBESlackロバート・ダウニー・Jr.エイミー・ワインハウスSDGsText-to-ImageモデルPixelllot S3Slack AIソフトバンクPokémon Battle Scopeダフト・パンクメモリスタAIスマートコーチポケットモンスターGlenn MarshallkanaeruThe Age of A.I.Story2Hallucination音声変換Latitude占いレコメンデーションJukeboxDreambooth行動ロジック生成AIVeap Japanヤン・ルカンConvaiEAPneoAIPerfusionNTTドコモSIFT福井千春DreamIconニューラル物理学EmemeDCGAN医療mign毛髪GenieMOBADANNCEメンタルケアstudiffuse荒牧英治汎用AIエージェント人事ハーバード大学Edgar Handy中ザワヒデキAIファッションウィーク研修デューク大学大屋雄裕インフルエンサーQA Tech Night中川裕志Grok-1mynet.aiローグライクゲーム松木晋祐Adreeseen HorowitzMixture-of-Experts東京理科大学下田純也NVIDIA Avatar Cloud EngineMoE人工音声NeurIPS 2021産業技術総合研究所桑野範久Replica StudiosClaude 3リザバーコンピューティングSmart NPCsClaude 3 Haikuプレイ動画ヒップホップ対話型AIモデルRoblox StudioClaude 3 SonnetソニーマーケティングPromethean AIClaude 3 Opusサイレント映画もじぱnote森永乳業環境音暗号通貨note AIアシスタントMusiioC2PAFUZZLEKetchupEndelゲーミフィケーションAlterationAI NewsTomo Kihara粒子群最適化法Art SelfiePlayfool進化差分法オープンワールドArt TransferSonar遊び群知能下川大樹AIFAPet PortraitsSonar+Dウィル・ライト高津芳希P2EBlob Opera大石真史クリムトDolby AtmosBEiTStyleGAN-NADASonar Music FestivalDETRライゾマティクスSporeクリティックネットワーク真鍋大度デノイズUnity for Industryアクターネットワーク花井裕也画像処理DMLabRitchie HawtinSentropyGLIDEControl SuiteErica SynthCPUDiscordAvatarCLIPAtari 100kUfuk Barış MutluSynthetic DataAtari 200MJapanese InstructBLIP AlphaCALMYann LeCun日本新聞協会プログラミングサム・アルトマン鈴木雅大AIいらすとやソースコード生成コンセプトアートAI PicassoGMAIシチズンデベロッパーSonanticColie WertzEmposyGitHubCohereリドリー・スコットAIタレントウィザードリィMCN-AI連携モデル絵コンテAIタレントエージェンシーUrzas.aiストーリーボードmodi.ai介護大阪大学BitSummit西川善司並木幸介KikiBlenderBitSummit Let’s Go!!サムライスピリッツ森寅嘉Zoetic AIゼビウスSIGGRAPH 2021ペットストリートファイター半導体Digital Dream LabsPaLM APIデジタルレプリカTopaz Video Enhance AICozmoMakerSuiteGOT7DLSSタカラトミーSkebsynthesia山野辺一記NetEaseLOVOTDreambooth-Stable-DiffusionHumanRF大里飛鳥DynamixyzMOFLINActors-HQRomiGoogle EarthSAG-AFTRAU-NetミクシィGEPPETTO AIWGA13フェイズ構造ユニロボットStable Diffusion web UIチャーリー・ブルッカーADVユニボPoint-EXLandGato岡野原大輔AI model自己教師あり学習DEATH STRANDINGAI ModelsIn-Context Learning(ICL)Eric Johnson汎用強化学習AIZMO.AILoRAMOBBY’SファインチューニングOculus Questコジマプロダクションロンドン芸術大学モビーディックグランツーリスモ生体情報デシマエンジンGoogle Brainダイビング量子コンピュータSound Controlアウトドアqubit写真SYNTH SUPERAIスキャニングIBM Quantum System 2照明Maxim PeterKarl Sims自動採寸北野宏明Joshua RomoffArtnome3DLOOKダリオ・ヒルハイパースケープICONATESizerジェン・スン・フアン山崎陽斗ワコールHuggingFace立木創太スニーカーStable Audio浜中雅俊UNSTREET宗教ミライ小町Newelse仏教テスラ福井健策CheckGoodsコカ・コーラGameGAN二次流通食品パックマンTesla Bot中古市場Coca‑Cola Y3000 Zero SugarTesla AI DayWikipediaDupe KillerCopilot Copyright Commitmentソサエティ5.0Sphere偽ブランドテラバースSIGGRAPH 2020バズグラフXaver 1000配信京都大学ニュースタンテキ養蜂立福寛東芝Beewiseソニー・ピクチャーズ アニメーション音声解析DIB-R倉田宜典フィンテック感情分析投資Fosters+Partners周 済涛韻律射影MILIZEZaha Hadid Architectsステートマシン韻律転移三菱UFJ信託銀行ディープニューラルネットワーク

AIはどこまで言葉から物を思い描けるか? text to image AIの研究事例を考察する

2021.5.28先端技術

AIはどこまで言葉から物を思い描けるか? text to image AIの研究事例を考察する

現在の画像認識AIは、画像に写っているオブジェクトが何であるかを認識してキャプションを高精度に生成できます。こうした「画像からの文章(image to text)の生成」とは入出力が逆転する「文章からの画像(text to image)の生成」の研究も進んでいます。この記事ではtext to image AIの研究事例をまとめることを通して、人間の想像/創造力を工学的に再現する試みの到達地点を明らかにします。

幼児が描く棒人間のレベル

テック系メディアUS版MIT Technology Reviewは2020年9月、著名なAI研究機関であるAllen Institute for AI(通称「AI2」)が発表した文章から画像を生成するAIを解説する記事を公開しました。

文章から画像を生成するAIの研究は、汎用的人工知能(Artificial General Intelligence:AGI)の実現に大きく寄与すると考えられています。というのも、言葉から物の姿を描く機能の研究は、人間に固有な能力とされる想像力をもったAIの実現につながるからです。もっとも、文章から画像の生成は、その反対の生成処理より難易度が高くなります。画像からの文章の生成は言わば情報を圧縮するのに対して、文章からの画像の生成は情報を補完する必要があるからです。こうした情報の補完処理は「想像力を膨らませる」人間の能力と類比的に捉えられます。

Text to image AIを開発するにあたり、AI2は入力が文章で出力が画像である学習データを使ってAIを訓練しました。訓練されたAI「X-LXMERT」は、同機関が作ったデモサイトから実行できます。例えば、デモサイトのテキスト入力ボックスに「凧と木々(Kites and Trees)」というテキストを与えると、以下のような画像が表示されます。生成された画像は、残念ながら「凧と木々」と言われればそう見えるかも知れない程度の精細度であり、言わば幼児が描く棒人間と大差ないものです。

AI2作成(Computer Vision Explorer」より画像を引用)

AI2の研究員Jiasen Luは、X-LXMERTの開発は「ピースが欠けているパズルのようなもの」とその難しさを語っています。ちなみに同AIに関する論文によると、学習データの規模は画像が18万枚でそれに対応した文章の合計は918万センテンスでした。

DALL-Eのからくり

2021年1月、text to image AI研究で大きな飛躍がありました。言語AI「GPT-3」を開発したことで知られる研究機関Open AIが、画像生成AI「DALL-E」を発表しました。

DALL-Eは、例えば「アボカドのかたちをしたアームチェア(an armchair in the shape of an avocado)」というテキストを入力すると、以下のような説得力のある無数の画像を生成します。注目すべきは、以下の画像はおそらく学習データには含まれておらず、同AIが入力にしたがって新規に生成したと考えられるところです。これらの画像と前述のX-LXMERTが生成した画像を比べると、その精細度はまさに雲泥の差です。

【関連記事】CGへの扉 Vol.22:言葉から画像を生成、DALL-Eはクリエイティブなのか?

OpenAIブログ記事「DALL・E: Creating Images from Text」より画像を抜粋

2021年2月末、DALL-Eの内部処理を詳述した論文が発表されました。その論文によれば、同AIにはGPT-3にも使われているAIモデルTransformerが活用されていました。そして、大量の画像と文章がペアとなった学習データで訓練したうえで、画像生成時には同AIと同時に発表された画像認識AI「CLIP」を実行して、入力テキストが意味するオブジェクトが生成されたかどうかチェックしていました。こうしたアーキテクチャの基本構成はX-LXMERTと大差なく、まったく新規なアルゴリズムが使われているわけではなかったのです。

DALL-EとX-LXMERTの決定的な違いは、AIのパラメータ数と学習データ量です。前者のパラメータ数が120億に対して、後者は170万、学習データは前者が2億5,000万の画像と文章のペアを使ったのに対して、後者は画像が18万枚でそれに対応した文章が918万センテンスです。パラメータ数に関して前者は後者の約700倍、学習画像枚数では約1,400倍となります。

DALL-Eの成果から言えるのは、前例のないような画期的なアルゴリズムを発明しなくても、パラメータ数と学習データ量を増やせば、人間の想像力と類比的な能力を高精度で実現できることです。X-LXMERT開発時に露見した「ピースが欠けたジグソーパズル」は、学習データによって補完可能だったのです。

もっとも、AIモデルのパラメータ数と学習データ量を増やすのは決して簡単なことではありません。実際、DALL-Eの訓練にあたっては学習データの圧縮処理がなされており、大規模な学習を実行できるハードウェア環境の構築には高い技術力が要求されます。OpenAIにはパラメータ数が1,750億のGPT-3を開発した実績があったため、DALL-Eのような巨大AIモデルを実現できたのです。

AIは「トラのなかのジャングル」の夢を見るか

テキストから画像を生成するAIを開発するのが難しい原因のひとつとして、DALL-Eが生成したアームチェアの画像を見れば分かるように、ひとつのテキストから無数の画像を生成できることが指摘できます。こうした生成の多様性こそが、AIに人間の想像力を実装する端緒となると考えられます。

Google傘下のAI研究機関DeepMindは2021年5月、テキストから画像を生成する際の多様性それ自体を生成するAIに関する論文を発表しました。「生成の多様性自体を生成する」とは、単一のテキストからそのテキストの意味から逸脱しない範囲でさまざまな画像を生成できるように、生成アルゴリズム自体を変化させることを意味しています。こうした変化する生成アルゴリズムを、論文では「視覚化の文法」と呼んでいます。

「視覚化の文法」が意味していることは、絵画における作家性と類比的に捉えられます。(聖母マリアと幼児のキリストを描いた聖母子像のように)言葉で説明すれば同じモノを描いた絵画は無数にありますが、そのなかでも(ラファエロの『聖母子像』のように)とくに「美しい」ものや「ユニーク」なものには高い価値が与えられて芸術作品として継承されていきます。芸術作品とは、画家が類を見ない形でアイデアを視覚化したものと言えます。こうしたユニークな制作能力が視覚化の文法に該当します。

視覚化の文法を生成するAIを開発するにあたり、DeepMindの研究チームは以下のようなプロセスを実行しました。

  1. 手順1:テキストと画像のペアを学習したAIを開発する。
  2. 手順2:手順1のAIに遺伝的アルゴリズムを応用した画像生成アルゴリズムを実装する。
  3. 手順3:手順2のAIにテキストを入力として与え、画像生成アルゴリズム自体を進化させながら、テキストの意味と一致するような画像を生成させる。

以上のプロセスで注目すべきは、画像生成アルゴリズムを遺伝的アルゴリズムで進化させる点です。遺伝的アルゴリズムにはランダム性も組み込まれているため、同一のテキストを与えても、入力のたびに異なった出力画像が生成されます。それゆえ、同じ画像は1枚もないのです。論文には「トラのなかのジャングル(Jungle in the Tiger)」というシュールレアリスムを連想させるテキストから生成された画像事例が掲載されています。以下の画像は、「ジャングルのようなトラ」あるいは「トラのようなジャングル」に見えなくもありません。

DeepMind論文「Generative Art Using Neural Visual Grammars and Dual Encoders」より画像を引用

生成された画像が「ジャングル」や「トラ」の模倣にとどまらないのは、変化する生成アルゴリズムがGANのように学習済みの画像に似せようとしていないからです。論文では視覚化文法生成アルゴリズムが「記憶にもとづいた絵画」だとすれば、GANは「記憶にもとづいた写真」であるとその違いを説明しています。そして、生成過程が模倣にとどまらないからこそ、「トラのなかのジャングル」のようなナンセンスなテキストからトラやジャングルを連想させる絵柄を出力できたと考えられます。

視覚化文法生成AIは人間の画家における作家性に近いものを再現していますが、どの画像を自らの「作風」とするかを決定できません。無数にありえる視覚化文法のなかからひとつの作風を選択する能力は、人間に固有な創造性のひとつと言えそうです。

以上に紹介した生成系AIの進化は、今後も続くと見て間違いありません。そして、こうしたAIが進化するたびに制作行為におけるAIと人間の役割分担の再考が促され、さらには「人間の想像/創造力とは何か」という問いも投げかけられることでしょう。

Writer:吉本幸記

RELATED ARTICLE関連記事

AIが著作物を学習する流れは止められない:月刊エンタメAIニュース vol.33

2022.9.22先端技術

AIが著作物を学習する流れは止められない:月刊エンタメAIニュース vol.33

ロバート・ダウニーJr.によるドキュメンタリー『The Age of A.I.』が伝えるAIの本質

2019.12.27先端技術

ロバート・ダウニーJr.によるドキュメンタリー『The Age of A.I.』...

【秋期GTC2022】3Dポーズ推定とメッシュ生成に関するNVIDIA最新研究を紹介

2022.10.28先端技術

【秋期GTC2022】3Dポーズ推定とメッシュ生成に関するNVIDIA最新研究を...

RANKING注目の記事はこちら