Nvidiaは企業向けメタバースを開発、リアルなAIアバターが人間に代わり顧客に応対する

今週、Nvidiaは開発者会議「Nvidia GTC 2021」で、メタバースの最新技術を公表した。Nvidiaはメタバースの開発環境を「Omniverse」という名称で製品化しており、企業はこのプラットフォームで3D仮想空間を生成し、ソリューションを構築する。基調講演で、人間のデジタルツインであるアバターの新技術が公開された。高度な言語モデルを組み込んだAIアバターが人間と会話するデモが実演された。(下の写真、CEOであるJensen Huangのフィギュア「Toy Jensen」が身振りを交えて人間と対話する。)

出典: Nvidia

Omniverseとは

Nvidiaは、3D仮想空間を開発するプラットフォームを「Omniverse」として提供している。企業は、Omniverseで3D仮想空間を生成し、ここで様々なシミュレーションを実行し、製造プロセスを最適化する。Omniverseは、既に多くの企業で導入されている。自動車メーカーBMWは、Omniverseで製造工場のデジタルツインを生成し、生産工程を最適化している。(下の写真、BMWは製造施設の高精度なコピーを3D仮想空間に生成し、ここで生産工程をシミュレーションし、効率などを検証した。)

出典: BMW  

人間のデジタルツイン

開発者会議では、Omniverseで人間のデジタルツインを生成する技法と応用事例が紹介された。この技法は「Omniverse Avatar」と呼ばれ、高度なAIを統合したデジタルヒューマンとなる。AIアバターは視覚を備えており、相手を見ながら人間と会話する。また、相手の話し言葉を理解し、AIアシスタントとして人間に助言する。AIアバターは3Dフィギュアとして生成され、レイトレーシング(Ray Tracing)を使って作画され、本物の人形が動いているように見える。

顧客サービスアバター:Project Tokkio

AIアバターが人間に代わり顧客に応対する。このプロジェクトは「Project Tokkio」と呼ばれ、AIアバターは顧客をビジュアルに認識し、対話を通して顧客をサポートする。その一つが上述の「Toy Jensen」で、3Dフィギュア形状のAIアバターが、身振りや手ぶりを交えて、顧客と対話する。

また、AIアバターが、レストランのキオスクで店員に代わり、顧客の注文を取る。AIアバターが顧客と会話しながら、料理の内容を説明し、好みを聞き、最適なメニューを推奨する(下の写真)。AIアバターは高度な会話能力を備えているが、この背後では世界最大規模の言語モデル「Megatron 530B」が稼働している。

出典: Nvidia  

自動運転車のアシスタント:Drive Concierge

クルマが自動運転車となると、AIアバター「Drive Concierge」が運転のアシスタントとなる。AIアバターは、クルマのディスプレイに表示され、ドライバーとのインターフェイスとなる(下の写真)。AIアバターがドライバーとの対話を通して、目的地と到着時間を理解し、時間通りに到着するために、最適な運転モードを選択する。

出典: Nvidia

ビデオ会議のアシスタント:Project Maxine

Nvidiaは、コラボレーション空間を生成するための開発環境「Project Maxine」を提供している。企業はこのプラットフォームを使って、遠隔勤務のためのビデオ会議空間(仮想オフィスなど)を構築する。開発者会議では、これを拡張した機能が紹介された。AIアバターをビデオ会議に組み込むもので、発言者の言葉をリアルタイムに翻訳する。(下の写真、英語で発言した内容がフランス語に翻訳される。フランス語で発声するだけでなく、口の動きもフランス語となる。) また、発言内容はテキストに変換して表示される。

出典: Nvidia

AIアバターを支える技術

AIアバターであるOmniverse Avatarは、多種類のAI技法を組み合わせて生成される。主なAI技法は次の通り:

  • Riva:対話型の言語モデル。音声認識機能で発言者の言葉を理解する。また、テキストを音声に変換する機能で、自然なボイスを生成する。
  • Megatron 530B:大規模な自然言語モデル。人間のように、言葉を理解し、また、言葉を生成する機能を持つ。文章を完結する機能や、質問に答える機能がある。更に、文章を要約したり、他の言語に翻訳する機能がある。
  • Merlin:深層学習に基づく推奨エンジン。
  • Metropolis:コンピュータビジョンでビデオの解析など利用する。

メタバースの標準プラットフォーム

Nvidiaはメタバース開発のためのプラットフォーム「Omniverse」を提供しており、企業はこの環境で3D仮想空間を生成する。メタバース開発のために、多くのエンジニアやクリエーターが異なるツールを使ってアプリケーションを開発する。Omniverseは異なるツールを連携し、共同開発のプラットフォームとなる(下のグラフィックス)。いま、世界各国でメタバースの開発が進んでいるが、これらは独自手法で構築され、固有のメタバースが数多く生成されている。Nvidiaは、Omniverseをオープンなメタバース開発環境と位置付け、業界標準となるプラットフォームを目指している。

出典: Nvidia

Meta(Facebook)はメタバースを構成する基礎技術の開発を加速、AR・VR技術を飛躍的に進化させリアルとバーチャル空間を融合する

Facebookは開発者会議Connect 2021で、メタバース(Metaverse)構想を明らかにした。メタバースとはインターネットに構築される3D空間で、次世代ソーシャルネットワークはここに構築される。メタバースは現実空間と仮想空間が融合したもので、ここで人々が交流しビジネスが営まれる。(下の写真、メタバースに構築されたオフィス)

出典: Meta

メタバースを構成する技術

メタバースを構築する基礎技術はAR(拡張現実)とVR(仮想現実)で、これらを融合しMR(複合現実)を生成する。これらがメタバース研究所「Facebook Reality Labs」で開発されている。現在のAR・VRを飛躍的に進化させ、リアルとバーチャルを融合したMR空間を生成する。Metaはメタバースをモバイルの次のプラットフォームと位置付け、AppleやGoogleに依存しないインターネットを生成する。(下の写真、現実空間に仮想オブジェクトを融合したMR空間。)

出典: Meta

メタバースを生み出す技術:Presence Platform

Metaが開発しているメタバースは、リアル社会とバーチャル社会を滑らかに融合するもので、これを生み出す技術は「Presence Platform」と呼ばれる。このプラットフォームは、コンピュータビジョンとAIが核となり、仮想オブジェクトを現実空間に組み込むためのモジュールから構成される。具体的には、MR(Mixed Reality)、オブジェクトのインタラクション、ボイスのインタラクションを生成する機能を提供する。MRとは、上述の通り、複合現実で、現実空間と仮想空間を融合し、メタバースの中心機能となる。

Presence Platformは三つのSDK(Software Development Kit)から構成される:

  • Insight SDK:現実空間に仮想オブジェクトを組み込みMRを生成する技術
  • Interaction SDK:手で仮想オブジェクトを操作する技術
  • Voice SDK:会話を理解する機能で言葉で仮想オブジェクトを操作する技術

SDKとはソフトウェア開発キットでエンジニアはこれらの機能を使ってメタバースを開発する。

MR空間を生成する技術:Insight SDK

Insight SDKはメタバースの中心技術で、高品質なMR空間を生成する。Insight SDKは「Passthrough」と「Spatial Anchors」の二つの機能から成る。

Passthrough機能

PassthroughはVRヘッドセットを介してMR空間を生成する技術で、現実空間に仮想オブジェクトを描写する。下の写真はOculus Quest 2を介してピアノのレッスンを受けている様子。ピアノの鍵盤に円形の仮想オブジェクトを表示し、これを指で叩くと音楽を演奏できる。Oculus Quest 2はカメラを搭載しており、前方のイメージを白黒で見ることができる。Oculus Quest 2はVRだけでなく、MRグラスとしての機能がある。

出典: Meta

Spatial Anchors機能

Spatial Anchorsはハンドセットで現実空間をマッピングする機能。下の写真はOculusのハンドセットを置かれた家具に沿って動かし、部屋の中をマッピングしている様子。システムは現実空間の構造を理解して、それに応じて仮想オブジェクトを表示するために使われる。

出典: Meta

Scene Understanding機能

Scene Understandingはユーザ空間を理解する機能で、空間の位置関係やその意味などを理解する。この中のScene Modelを使って部屋の中にMR空間を生成する。下の写真は部屋の空間に仮想オブジェクト(暖炉や窓の外の景色)を挿入しMR空間を生成したもの。このようにPassthrough、Spatial Anchors、Scene Understandingを使って、複雑で、かつ、物理空間の意味を理解したメタバースを開発できる。

出典: Meta

手の動きを表現する技術:Interaction SDK

Interaction SDKは手やハンドセットの動きを仮想空間の中で表現するために使われる。手で仮想オブジェクトを掴んだり、触ったり、ポイントするなどの動作を司る。下の写真は、手で仮想のコーヒーマグの取ってを掴んでいる様子。Interaction SDKは、コンピュータビジョン使い、AIが手の動きをトラックし、オブジェクトとのインタラクションを把握する。

出典: Meta

話し言葉を理解する技術:Voice SDK

Voice SDKは自然言語解析の機能で、話し言葉により、ハンズフリーのオペレーションができる。これをゲームに適用すると、音声でプレーするゲームを開発できる。Voice SDKは、音声でのナビゲーションの他に、音声での検索や、音声でのQ&A機能を提供する。下の写真は、仮想のキャラクター「Oppy」の名前を呼ぶと、言葉の意味を理解して近づいてくる。

出典: Meta

次世代VRヘッドセット:Project Cambria

Metaは次世代のVRヘッドセットを開発している。このプロジェクトは「Project Cambria」と呼ばれ、ハイエンドのVRヘッドセットとなる。Project CambriaはSocial Presence機能やカラーのPassthrough機能を備えている。現在、Metaは消費者向けにVRヘッドセットOculus Quest 2を販売しているが、Project Cambriaはこの後継モデルではなく、ハイエンドの製品ラインとなる。

出典: Meta

モバイル向けAR:Spark AR

「Spark AR」はモバイル向けのAR開発環境で、既に多くのコンテンツが開発されている。これはMobile ARと呼ばれ、スマホのアプリに組み込んで利用する。例えば、顔に特殊効果を挿入する際にSpark ARが使われる。下の写真は、Spark ARで顔に特殊メイクを施し、妖怪に変身する事例。Metaは、このSpark ARを拡張し、メタバース向けに高度なARを開発している。

出典: Meta

ARグラス:Project Aria

MetaはARグラス「Project Aria」を開発している(下の写真右側)。これは、グラスにカメラとディスプレイを搭載した構造で、目の前の現実空間に仮想オブジェクトをインポーズする。ARグラスはDigital Assistantとなり、AIが周囲のオブジェクトの種別や意味を理解する(下の写真左側、ソファーやテーブルを認識する)。更に、AIは利用者の意図を把握して、次の行動をアシストする。利用者が電灯に視線を向けると、スイッチががオンになるなどの機能がある。

出典: Meta

ARグラスへの入力:Electromyography

ARグラスにデータを入力する方法が課題になるが、MetaはElectromyography(筋電図)という技法を開発している。これは筋肉で発生する微弱な電場をAIで解析することで、その意図を推定するもの。手首にデバイスを装着しElectromyographyを計測する。指でアルファベットを書くと、このデバイスがテキストに変換する(下の写真、テキストメッセージを入力している様子)。

出典: Meta

コンセプトの段階

Metaはメタバースの概要を始めて公開したが、これらはまだ製品ではなく、コンセプトの段階である。今回の発表はProof of Conceptを示し、メタバースが完成した時の製品イメージを提示することを目的とした。これによると、AR・VR・MR技術が大きく進化し、メタバースは現実空間と仮想空間が滑らかに融合した社会であることが分かった。一方、メタバースはより深い個人データを使うことも分かり、個人情報の保護がより厳しく求められる。

Facebookは社名を「Meta」に変更しメタバース企業となる、3D仮想空間で人々が交流するプラットフォームを開発する

Facebookは、開発者会議「Connect 2021」で、ソーシャルメディア企業からメタバース(Metaverse)企業になることを発表した。CEOのMark Zuckerbergがメタバース空間で明らかにしたもので(下の写真)、これに伴い、社名も「Facebook」から「Meta」に変更する。Facebookは創設以来最大の危機に直面しており、社名を変えることで、新生企業として再出発する。一方、Metaが開発しているメタバースは、従来の技法から大きく進化したもので、スマホの次のプラットフォームになる可能性を秘めている。

出典: Meta

メタバースとは

メタバースとは、インターネットに構築された3D仮想社会で、ここに人々が集い交流する。従来のVR空間とは異なり、メタバースでは利用者が仮想社会と連動し、そこに存在している感覚「Social Presence」を覚える。次世代のソーシャルネットワークはメタバースに構築される。Facebookは、メタバースをモバイル・インターネットの次のプラットフォームとして位置付け、技術的に大きな飛躍となる。但し、メタバースは今すぐに使えるサービスではなく、完成までに時間を要すことも明らかにした。Facebookはそのビジョンを示したもので、これに向かって技術開発が進んでいる。 (下の写真、メタバースの事例、無重力空間で友人同士がアバターを介して交流している様子。)

出典: Meta

家庭向けのメタバース

Zuckerbergは基調講演で、メタバースの様々な利用方法を紹介した。その一つが家庭向けのメタバースで、「Horizon Home」と呼ばれる。これはVRヘッドセット「Oculus」を着装して利用するサービスで、複数の友人がメタバースに集い、それぞれのアバターを介して交流する(下の写真)。お互いに会話するだけでなく、グループでゲームをプレーするなど、アバター同士がインタラクションできることに特徴がある。

出典: Meta

企業向けのメタバース

今回の発表に先立ち、Facebookは企業向けのメタバースを発表している。これは、「Horizon Workrooms」と呼ばれ、遠隔勤務向けのコラボレーションシステムとなる。社員はアバターを介してビデオ会議に出席し、他の社員とインタラクションしながら、会議を進める(下の写真)。ホワイトボードに説明資料を表示するなど、リアルのオフィスを仮想空間に構築する。

出典: Meta

メタバースでゲームをプレー

ゲームはメタバースの重要なアプリケーションで、既に数多くのコンテンツが開発されている。ARグラスを着装すると、海外に住む友人とチェスを対戦することができる(下の写真)。また、VRヘッドセットを着装すると、没入型のゲームを体験できる。OculusはVRゲームを数多く開発しおり、ヒット商品は「Beat Saber」で、飛んでくる物体を刀で切り落とす。

出典: Meta

メタバースでフィットネス

近年は、ジムでエクササイズをする代わりに、自宅でVRヘッドセットを着装してトレーニングする人が増えた。フィットネスバイクは、仮想のスタジオで、インストラクターの指示に従ってペダルを漕ぐ(下の写真)。また、「Supernatural Boxing」シリーズは、VRボクシングを通したエクササイズで、巨大なモンスターと対戦する。

出典: Meta

仮想空間で教育

メタバースは教育プラットフォームとして使われる。ARグラスを着装して土星を見ると、目の前にその構造が描写される。土星の環の中に入ると、無数の氷の塊で構成されていることが分かる。また、VRヘッドセットを着装すると、古代ローマの都市に降り立つことができる(下の写真)。市場で売られている魚や果物を見て、街の賑わいを感じる。また、建造物のアーキテクチャや建設方法を学ぶことができる。

出典: Meta

社名の変更

Zuckerbergは、社名を「Facebook」から「Meta」に変更したことを明らかにし、その理由をメタバース企業に転身するためと説明した。Metaはギリシャ語で「Beyond」という意味で、ソーシャルネット―ワークの次の章が始まることを示している。既存サービスの名称はそのままで、Metaの配下でFacebook、Instagram、WhatsAppがビジネスユニットとして事業を継続する。(下の写真、本社の前のパネルは新しいロゴに置き換わっている。)

出典: Meta

Facebook Papers

いま、Facebookは創業以来最大の危機に直面している。Facebookの元社員が、社内資料を公開し、会社は利用者の安全を犠牲に利益を上げていると告発した。持ち出された大量の社内資料は「Facebook Papers」と呼ばれ、Facebookのアルゴリズムやビジネス慣行が記載されている。Zuckerbergはこの危機を乗り越えるため、社名をMetaとし、新生企業として出直しを図り、社会からの批判を避ける思惑もある。

Facebookは人間の日常生活でAIを教育、ARグラスに搭載しアルゴリズムが利用者の視覚や聴覚をエンハンス

Facebookは人間の視線で周囲の状況を把握するAIの研究を開始した。このプロジェクトは「Ego4D」と呼ばれ、人間の視線で捉えたデータ(下の写真)でアルゴリズム教育することで、AIは実社会でインテリジェントな能力を発揮する。これをARグラスやVRヘッドセットに搭載することで、AIがアシスタントとなり利用者の視覚や聴覚をエンハンスする。また、これをロボットに搭載すると、実社会で自律的に稼働する機能を得ることができる。

出典: Facebook

当事者の視点で環境を理解

コンピュータビジョンの進化でAIはオブジェクトを認識しその種別を正確に判定する。しかし、これらのAIは第三者視点(third-person perspective、下の写真左側)で開発されたもので、傍観者としてオブジェクトを判定する。これに対し、Facebookは第一者視点(first-person perspective、右側)でアルゴリズムを教育する研究を開始した。この技法は「Egocentric Perception」と呼ばれ、開発されたAIは当事者の視点でオブジェクトを判定できるようになる。これをARグラスやVRヘッドセットに搭載すると、AIがアシスタントとして周囲の状況を把握し最適な助言を行う。また、ロボットへ適用すると、AIが視覚となり実社会の中を自律的に稼働するシステムにつながる。(下の写真はサイクリングに関する画像認識の判定結果。第三者視点で開発されたAIの判定精度は高いが(左側)、第一者視点で開発されたAIの判定精度はまだ低い(右側)。)

出典: Facebook

開発したAIの利用方法

FacebookはARグラスの開発を進めており、その第一弾としてスマートグラス「Ray-Ban Stories」を発表した。これから製品化されるARグラスには第一者視点のAIが搭載され、インテリジェントなアシスタントとして使われる。AIが周囲のオブジェクトを見てその種別などを把握する。例えば、ARグラスで日常生活を録画しておくと、AIはこれを解析して利用者の質問に回答する。「祖母の腕時計をどこに片づけた」と質問すると、AIは過去のビデオを解析し、ARグラスにその場所を表示する(下の写真)。

出典: Facebook

大学との共同開発

利用者の視点でオブジェクトを判定するAIを開発するためには、アルゴリズムを教育するための大量のデータが必要になる。このため、Facebookは各国の大学と共同研究をすすめ、利用者視点のデータを集約して教育のためのデータセットを開発している(下の写真)。世界から13の大学が参加しているが、日本からは東京大学がこのプロジェクトに加わっている。

出典: Facebook

データセットの構成

開発者はスマートグラスなどを着装してカメラで日常生活を録画する。これら録画されたビデオにその意味を付加して、生活の中での動きとその説明文のペアを作る。これらのビデオを集約したデータセットを構築し、これらのデータを使ってAIを教育するプロセスとなる。日常生活の様式は国により異なり、Facebookは主要国の大学と共同でこれを進めている。(下の写真;皿洗いを撮影したビデオで、左からサウジアラビア、イタリア、ルワンダの事例となる。)

出典: Facebook

アルゴリズム教育

次は、生成したデータセットを使ってアルゴリズムを教育するステップとなる。ここがAI開発のコアで、Facebookはこれを研究課題として提示し、大学や研究機関の研究者がこれに挑戦する形式をとる。チャレンジは五つのテーマから構成される。

  • イベントの記憶(Episodic memory): AIはいつどこで何があったかを把握。(上述の事例の通り、祖母の腕時計をどこに格納したかを把握。)
  • 予測(Forecasting): AIはビデオをみて次のアクションを予測。
  • 手作業(Hand and object manipulation): AIは手の動きからどんな作業をしているかを把握。(ドラムを演奏する方法を把握し、それを教える(下の写真)。)
  • 音声映像の記録(Audio-visual diarization): AIはだれが何を言ったかを把握。
  • 人間関係(Social interaction): AIは誰と誰が会話しているかなど人間関係を把握。
出典: Facebook

AIビジョンの進化

AI開発でオブジェクトの形状を把握するコンピュータビジョンが急成長しているが、アルゴリズムを教育するためのデータセットが技術進化を支えている(下の写真)。AI開発の初期には手書き文字を判読するためのデータセット「MNIST」が開発された。コンピュータビジョンが急速に進化したのは、イメージのデータセット「ImageNet」の存在が大きい。ここには大量の写真とタグが格納され、これによりAIが人間の視覚を上回った。これらはすべて第三者視点のデータセットで、Ego4Dが第一者視点の最初のデータセットとなる。

出典: Facebook  

Microsoftは超リアルな3Dフェイスを生成、顔写真の代わりに合成メディアで顔認識AIを教育できることを実証

Microsoftは合成メディア(Synthetic Media)の手法で3Dフェイスを生成した(下の写真)。これは顔認識AIを教育するためのモデルで、実物と見分けのつかない超リアルな3Dフェイスが生成された。今まではセレブなど実在の人物の顔写真を使って顔認識AIを教育してきた。しかし、これらの写真は本人の了解を取らないで無断で使われ、個人のプライバシーを侵害するとして社会問題となっている。このため、Microsoftは、これらのデータセットを消去し、合成メディアの手法で3Dフェイスを作成し、これをアルゴリズム教育に活用できることを実証した。

出典: Erroll Wood et al.

研究の意義

倫理的に顔認識AIを教育するために、人工的に3Dフェイスを生成し、これでアルゴリズムを教育する手法が取られてきた。しかし、合成データで教育するとアルゴリズムの判定精度が落ちるという問題が発生する。しかし、Microsoftは高品質の合成データを生成し、教育したアルゴリズムは写真データで教育したものと精度が変わらないことを示した。つまり、顔認識AIを教育するために、ネット上の顔写真をスクレイピングすることは不要で、合成データで倫理的に開発できる道筋をつけた。

顔認識AIの精度

合成データで顔認識アルゴリズムを教育すると、判定精度は写真で教育した場合と同等であることが示された。顔認識アルゴリズムは顔のパーツを判定する機能(Face Pursing)があり、鼻や口や目やまつ毛などを識別して色で示す(下の写真左側)。実際にベンチマークすると、写真で教育したものとほぼ同等の精度となることが証明された。また、顔認識アルゴリズムは顔の特徴量(Landmarks)を特定する機能があり、合成データで教育すると10倍精密なランドマークを生成できる(右側)。

出典: Erroll Wood et al.

Dフェイスモデル

MicrosoftはAIの手法(Generative 3D Face Model)で人物の頭部を三次元で生成する。これは3Dフェイスモデルと呼ばれ、生成されたモデルは実在しない人物の顔を超リアルに生成する。この手法はハリウッドの映画スタジオで使われる特撮技術(Visual Effects (VFX))で、映画スターがデジタルに生成されている。しかし、Microsoftの場合は教育データを大量に生成する必要があり、超リアルな3Dフェイスモデルを数多く生成する技法を開発した。

モデル生成のプロセス

このため、Microsoftはテンプレートを基準にして、それを変形する手法で多数の3Dフェイスモデルを生成した。まず、AIはテンプレートとなる3Dフェイスモデル(下の写真左端)を生成する。これをベースに、このモデルに個性(左から二番目)、表情(三番目)、スキン(四番目)、頭髪(五番目)、衣服(六番目)、背景(右端)を付加する。これにより、リアルで多様性のある3Dフェイスモデルを生成することができた。

出典: Erroll Wood et al.

Dフェイスモデルの多様性

3Dフェイスモデルで教育された顔認識AIは特定の人種にバイアスすることなく公平に判定できることも示された。Microsoftは3Dフェイスモデルで教育した顔認識AIを多様性データセット「The MUCT Face Database」を使ってその判定精度を検証した(下の写真)。このデータセットは異なる性別や多様な人種で構成されており、多様性を検証するために使われる。また、光の状態も様々で、現実社会に近い環境で顔認識AIの精度を検証できる。教育した顔認識AIはこのデータセットで正しく判定し、多様性のある実社会で利用できることが示された。

出典: Erroll Wood et al.

データセットを公開

Microsoftは生成した3DフェイスモデルをGitHubに公開しており、研究開発の目的で自由に利用することができる。公開されているモデルの数は10万で、それぞれのモデルには70のアノテーションが付加されている(下の写真、フェイスモデルとアノテーション)。研究者はこのモデルを使うことで、倫理的に顔認識AIを開発できる。

出典: Microsoft

顔写真データセットを消去

これに先立ち、Microsoftは著名人の顔写真データセット「Microsoft Celeb (MS-Celeb-1M)」を開発し、これを公開していた。これは著名人の顔写真100万枚を格納したデータセットで、顔認識AIの教育で利用されてきた。しかし、Microsoftはデータセットに格納している顔写真について、本人の同意を得ていないとして、全てのデータを消去し公開サイト「MS Celeb 」を閉鎖することを決定した。顔写真収集に関する議論が広がる中、Microsoftは他社に先駆けてこれらを利用しない方針を打ち出した。

顔写真をスクレイピング

これとは対照的に、新興企業「Clearview」は顔認識AI開発するために、ソーシャルネットワークに掲載されている顔写真をスクレイピングしてアルゴリズムを教育した。写真の数は30億枚を超え、世界最大規模の顔写真データセットを構築した。Clearviewが開発した顔認識アルゴリズムは判定精度が高く、全米の警察で犯罪捜査に利用されている。これに対し、市民団体は、個人の顔写真を許可無く使用することは違法であるとして、Clearviewに対し集団訴訟を起こした。

出典: Erroll Wood et al.

合成メディアの手法で生成

フェイスブックなどに掲載している顔写真を収集し、これを顔認識AIの教育で使うことが社会問題となっているなか、倫理的な開発手法の模索が続いている。消費者の了解を得て顔写真を収集するのでは大量のデータを準備できない。Microsoftは高品質な3Dフェイスモデルを大量に生成することに成功し、教育データを合成メディアの手法で生成する方式に注目が集まっている。