カテゴリー別アーカイブ: 人工知能

トランプ大統領誕生でベーシックインカムの議論が盛り上がる、AIによる大失業時代には必須の政策か

Trump氏の勝利は行き過ぎた格差社会に不満を抱えている労働者層からの支持によるところが大きい。Trump新大統領は格差を是正することを掲げ、米国に雇用を呼び戻し賃金を上げると約束した (下の写真)。選挙結果を受けシリコンバレーではUniversal Basic Income (最低所得保障) の議論がクローズアップされている。低所得者層に現金を支給し、行き過ぎた格差を是正する試みが始まった。

出典: Donald J. Trump for President, Inc.

Universal Basic Incomeとは

AIやロボティックの進化で多くの人が職を失うことが懸念される。失業者対策の一つとしてUniversal Basic Income (以降ベーシックインカムと記載) が議論されてきた。ベーシックインカムとは社会保障の一種で、市民は定期的に一定額の給付金を政府や公共機関から受ける制度を指す。市民は受け取るお金で最低限の生活を送ることができる。

ベーシックインカムの争点を纏めると

ベーシックインカムの基本コンセプトは貧困層だけでなく国民全員に補助金を支給することにある。これを導入することで、福利厚生施策を廃止してベーシックインカムに一本化する。住宅補助、食糧支援、高齢者医療などの施策の代わりに、ベーシックインカムを運用する。これにより政府組織がシンプルになり、福利厚生政策の運用コストが下がるという利点がある。

一方、ベーシックインカム導入には大規模な財源が必要でこれが最大の障壁となる。更に、国民に生活費を支給すると勤労意欲が失われるという懸念が根強くある。ただ近年は、AIに起因する失業対策としてベーシックインカムの必要性が注目を集めている。Trump新大統領の誕生で社会格差の深刻さが認識され、ベーシックインカムの議論が一気に活発になった。

AI研究者がベーシックインカムの必要性を訴える

AI研究を牽引する著名人がベーシックインカムの必要性を訴えている。Baidu研究所所長Andrew Ngは大統領選挙の翌日、ベーシックインカムの必要性をブログに投稿した (下の写真)。Ngは「選挙結果は不公平感による不満を反映している」と述べ、「住民の底辺を支えるためにベーシックインカムが必要」と主張。併せて「すべての人が(社会の階段を)上るために教育も必要」と述べている。大統領選挙で露呈した格差問題を解決する施策の一つとしてベーシックインカムに注目している。

出典: Andrew Ng @ Twitter

既に実証実験が進んでいる

高度なAI技術を生み出すシリコンバレーで、既にベーシックインカムの実証実験が進んでいる。著名インキュベータY Combinator社長Sam Altmanは2016年5月、ベーシックインカムの試験運用を始めると発表した (下の写真)。San Francisco対岸のOaklandでトライアルが始まった。この地区で100家族を選び、毎月1000ドルから2000ドル程度の現金を支給する。期間は6か月から1年の間で、受給者は受け取ったお金を自由に使うことができる。

Oaklandは経済格差が顕著な場所

Oaklandは富裕者層と貧困層の間で経済格差が顕著な都市である。同時に、Oaklandはハイテク企業の流入で地域住民との関係が悪化している。これはGentrification (都市部の高級化) と呼ばれ、裕福なハイテク企業社員が街に入り物価や住居費が高騰し、住民が郊外に転出せざるを得ない問題が発生している。Y Combinatorはこれら住民にベーシックインカムを提供することで問題を緩和できるのか検証を進めている。この実証実験が上手くいけば、本格的なプログラムに移行するとしている。

出典: Y Combinator  

なぜ民間企業が社会保障施策を手掛けるのか

ベーシックインカムの実証実験はカナダやフィンランドなどで実施され、Oaklandのプロジェクトが初めてというわけではない。しかし、ベーシックインカムという社会保障政策を民間企業が手掛けている点に特徴がある。なぜ民間企業が担うのかという疑問に対しては、Y Combinatorは明確な回答は示していない。ベーシックインカムは現在施行されている失業保険などのセーフティネットの代わりとなると述べるにとどまっている。

AI開発企業の新しい責務となるのか

技術進化により職が失われていくと、多くの人が収入を失い生活に行き詰る。その原因を生み出した企業は社会的な責務を果たすべきという見方が生まれてきた。その一つの手段としてベーシックインカムに注目が集まっている。今までもITによる自動化で多くの職がコンピュータに置き換えられた。しかしAIによる自動化は今までと比べ物にならないほど社会に与える影響が大きい。Y Combinatorの実証実験は、AIやロボットや自動運転車を開発する企業は社会貢献のあり方を見直すべきとのメッセージを含んでいる。

Elon Muskはベーシックインカムの必要性を認める

シリコンバレーの著名人はベーシックインカムに関し、将来を見据えた考え方を示している。Tesla創業者Elon MuskはCNBC放送のインタビューで、ベーシックインカムは必要になるとの見解を示した (下の写真)。Teslaは完全自動運転車の開発を目指している。また、Tesla製造工場はロボットによる自動化が進んでいる。これにより職業ドライバーや工場労働者は自動運転車やロボットに置き換えられ職を失う可能性が高くなる。

出典: CNBC  

社会格差が進むと平和な社会が脅かされる

この流れは自動車産業だけでなく他の産業でも起こり、自動化による失業が世界規模で発生する。人員削減で企業は高い利益を生み出すことができるが、利益を再分配するメカニズムが無ければ、収入の格差が今以上に増大する。ひいては、社会や経済が不安定になり、平和な世界が脅かされる危険性を含む。Muskは自社で技術開発を進めるだけでなく、会社としての社会的責任を負う必要があるとを認めている。

仕事をしないと人は存在価値を見失う

ベーシックインカムを導入すると最低限の生活が保障され安定した生活ができる。人々は働かなくても一定の生活が約束される。しかし、働かなくても生活ができれば、人はその存在意義を問われることになる。人は生活を支えるためには嫌な仕事でもこなすが、同時に、仕事を通して自分の価値を証明し、存在意義を確認している。仕事をしなくても生活できれば、自分の価値を見失うという問題が生じる。

人間のクリエイティビティを解き放つ

その一方、いやな仕事から解放されると人間は創造性を発揮するという考え方もある。ベーシックインカムで最低限の生活ができると、人々は興味を持っていることを自由に探究できる。絵を描くのが好きな人は時間に拘束されないで、この道を探求できる。プログラミングが好きな人は自由にハッキングできる。ベーシックインカムが導入されていない現在でも、創造性は個人の自由な活動から生まれることが見受けられる。人間のように振る舞う高度な自動運転アルゴリズム (Comma.ai) は天才青年 (George Hotz) の趣味が高じて生まれた。

近未来のすがた:ロボットが生産し人が消費する社会へ

Singularity (AIが人類を凌駕するポイント) の到来を主張するRay Kurzweil (現在はGoogle研究員) も同様な考え方を示しているが、AI大量失業時代の次はAIが人類を養う時代が来ると予測する。AIやロボットによる自動技術の進化で、全人類の生活を支えるだけの生産ができ、人は働く必要はなくなる。そうなると人々は働かなくなるのではなく、「仕事」を続けると主張。「仕事」とは誰かに命じられてこなすタスクではなく、自分が取り組みたいことを指す。つまり、生きがいを感じない労働から解放されることを意味する。

人類の創造性の爆発が起こる

いつの時代も人間は働くことに喜びを感じる。そして地球規模で人々が「仕事」をすると、人類の創造性の爆発が起こるとも予言する。高度AI社会では地球規模で創造性が開花し、新しい文明が生まれる。このバラ色の予測に対し反対意見も少なくないが、ベーシックインカムは常にAIの進化と対で議論される。

国民的な議論が広がる兆し

翻ってTrump新大統領とともに上院と下院で勝利した共和党はベーシックインカムの考え方と親和性が高い。Obama政権が運営してきた社会保障制度に一貫して反対の意思を示し、共和党は小さな政府に引き戻すと繰り返し主張している。 (下のグラフは食糧支援を受けている人の数の推移でObama政権で急増していると主張。社会保障制度が肥大化していることを意味する。) Trump新政権の四年間はAIやロボティックス技術が劇的に向上し、大量失業時代に突入することが懸念される。実証実験を含む検証作業などを通し、ベーシックインカムの国民的な議論が広がる兆しを感じる。

出典: Donald J. Trump for President, Inc.  

Googleは人工知能スピーカー「Home」を出荷、スマホの会話型AIが家庭に入ってきた

Googleは人工知能スピーカー「Google Home」の出荷を開始した。会話型AI「Google Assistant」を実装し、言葉で質問すると音声で答える。AssistantはGoogle独自のスマートフォン「Google Pixel」で使われている。Googleは同じアシスタント機能をスマホと家電で展開する。Homeを使うと家の中が一気にインテリジェントになり、AI家電に大きな将来性を感じる。

出典: VentureClef

音声で操作するスピーカー

Googleは2016年11月、AIを搭載したスピーカー「Google Home」 (上の写真) の出荷を開始した。Homeは会話型AI「Google Assistant」を搭載し、音声がインターフェイスとなる。Homeは丸みを帯びた円柱形のデバイスで家庭内に置いて利用する。HomeはAmazonのヒット商品「Amazon Echo」のアイディアを踏襲している。先行しているEchoをHomeが追う展開となっている。

HomeにOk Googleと語り掛ける

Homeの上部はタッチスクリーンで、ここにLEDライトが埋め込まれている。LEDライトは利用者の声に反応して点滅する。LEDライトの様々な動きでHomeの状態を示す。タッチパネルに指で円を描くように動かすと音量を調整できる。背後にはマイクをオンオフするボタンがある。Homeは常に周囲の声を聞いており、ボタンを押すとこれがオフとなる。Homeに話しかけるときは「Ok Google」と言えば、これに続く言葉を認識する。

複雑な質問に答える

Homeは情報検索で威力を発揮する。ここが他社に比べ大きな優位点となる。例えば「what time will the sun rise」と聞くと、「the sun will rise 6:39 AM」と答える。これは簡単な質問だが、複雑なクエリーにも的確に答える。「What was the US population when NASA was established」と尋ねるとHomeは「174.9 million」とズバリ回答する。(下の写真左側はHomeに問いかけた内容で、右側はAssistantが答えた内容。)

出典: VentureClef

幅広い知識を持つ

Homeは幅広い知識を持ち、スポーツの試合結果を回答する。「who won the world series」と聞くと「the world series was won by Chicago Cubs」と答える。翻訳機能もあり、「what’s good morning in Spanish」と聞くと「Buenos días」と答える。健康管理では食事の時に食物のカロリー量を知ることができる。「how many calories in an apple」と聞くと、「there is 95 calories in one medium apple」と答える。

会社の秘書のように働く

HomeはGoogle Calendarとリンクし筆者の予定を把握している。このためHomeに「what’s my next event」と質問すると、次の打ち合わせ予定などを回答する。出張などで飛行機を予約している時は、フライトスケジュールを教えてくれる。「is my flight on time」と質問すると、飛行機が予定通りに出発するかどうかを回答する。Homeは会社の秘書のように働いてくれる。

中心機能はエンターテイメント

Homeの中心機能はエンターテイメントで、音楽やニュースをスピーカーで聞くことができる。Homeに「play music by Lady Gaga」と指示するとレディー・ガガの音楽を再生する。聞きたい音楽の題名を指定する時は「play Poker Face by Lady Gaga」と語り掛けるとポーカーフェイスを流す。ラジオ放送を聞きたいときは「Play KCSM」と放送局を指定する。この他に、CNNなどのニュース放送やNFLなどスポーツ番組もそろっている。

テレビを音声で操作する

Homeを使って圧倒的に便利だと感じるのがテレビを音声で操作する機能だ。HomeはGoogleのストリーミングデバイス「Chromecast」経由でビデオや音楽コンテンツをテレビに配信する。音楽を聴きたいときは「play music by Beyoncé on my TV」と指示すると、Google Play Musicからビヨンセの音楽がテレビで再生される (下の写真)。当然だがテレビのスピーカーで聞く音楽はHomeで聞くより迫力がある。

出典: VentureClef

テレビでビデオをみる

見たい番組を指示すると、HomeはそのコンテンツをYouTubeから探し出し、テレビにストリーミングする。Homeに「play CNN News on my TV」と指示すると、この番組がYouTubeからChromecastを経由してテレビにストリーミングされる (下の写真)。今まではスマホを操作して番組をテレビにストリーミングしていたが、音声操作で格段に便利になった。

まだ複雑な指定はできないが

YouTubeには幅広いコンテンツが揃っていて、人気チャンネル「History Channel」や「National Geographic」などをテレビにストリーミングできる。「trending videos…」と言えばいま人気上昇中のビデオが配信される。但し、見たい番組を細かく指示するのは難しい。例えば、CNBC放送でElon Muskの会見の模様を見るために「play Elon Musk on CNBC on my TV」とHomeに指示するが上手くいかない。まだ、複雑な指定はできないが、これからの機能拡張を期待する。

出典: VentureClef

検索結果をテレビで見る

Homeを使うと検索結果をテレビに表示することができる。例えば「can you show me Hubble Telescope on my TV」と指示すると、ハッブル望遠鏡についてのビデオをテレビに配信する。知りたい情報をテレビで見ることができ、Homeはエンターテイメントだけでなく教育ツールとしても使えそうだ。

Chromecastをテレビにセット

この機能を使うためには、テレビ側にChromecast挿入しておく (下の写真、円形のデバイス)。ChromecastはAndroidやブラウザーからコンテンツをテレビにストリームングするために開発された。Homeはこの仕組みを利用して、音声でChromecastを操作する。

その際、Chromecastに名前を付けておけば (筆者のケースでは「TV」)、Homeに対して「play CNN on TV」と指示するとストリーミングが始まる。Homeの機能は多彩だが、音声でのストリーミング機能は予想外に便利だ。テレビを含む家電のインターフェイスが会話型AIに進化するのは間違いない。

出典: VentureClef

スマートホームのハブ

Homeはスマートホームのハブとなり、電灯や空調などを操作する。Homeをスマートライト「Philips Hue」とリンクすると音声でLEDライトをオンオフできる。例えば「turn on living light」と指示すると、リビングルームの電灯が点灯する。HomeがサポートしているスマートデバイスはPhilips Hueの他に、NestやSmartThingsなどがある。

Homeのエコシステムは拡大中

登場したばかりのHomeで使える第三者サービスの数は限られている。音楽ではSpotifyとPandoraを、ラジオではTuneInを利用できる。配車サービスではHomeでUberを呼ぶことができる。Googleの自社サービスではGoogle Play Music とYouTube Musicを使える。ビデオではYouTubeを使うことができるが、前述の通りChromecastをテレビに接続しておく必要がある。

Amazon Echoの優位点はスキル

Google Home (下の写真左側) とAmazon Echo (同右側) はAIスピーカーとして開発され両者の機能はよく似ている。一方、先行しているEchoは幅広い第三者サービス (Skillと呼ばれる) を備えている。今では2000本近いSkillがあり、病気の診断やスマートホームのハブとして使われている。Echoに指示すれば焼き立てのピザが届く。幅広いタスクを実行できる点でEchoがHomeに差をつけている。

出典: VentureClef

Google Homeの優位点は情報検索

Google Homeは複雑な質問を理解し情報検索できる点が大きな優位点となる。更に、Homeは利用者の個人情報を幅広く把握している。HomeはGoogle CalendarやGoogle Keepと連携し、予定や備忘録を管理する。気の利く秘書のように一日の予定や出張を手助けしてくれる。また、Chromecastとリンクすることで結果をテレビに出力できる。Google Pixelのコア技術であるAssistantを家庭に展開した構造で、Google Homeに大きな将来性を感じる。

Google PixelはApple iPhoneを超えた!スマホがAIで構成される

Googleは独自に開発したスマホ「Pixel」を投入した。ハードウェア機能が格段に向上しただけでなく、AIが利用者とのインターフェイスとなる。PixelはGoogleが運営するMVNO (仮想モバイルネットワーク) で利用できる。Googleモバイル事業はAndroidとハードウェアとネットワークを垂直に統合したモデルに進化した。Pixelを使ってみると先進的な機能に感銘を受け、これが近未来のスマホの姿を示していると実感した。

出典: Google

独自ブランドのスマートフォン

Googleは2016年10月、Googleブランドのスマートフォン「Pixel」 (上の写真) の販売を開始した。手に取ってみるとPixelはiPhoneと見間違うほど似ている。よく見るとPixelの表面にはホームボタンはなく、背後に円形の指紋センサー (Pixel Imprint) が搭載されている。ここに指をあててデバイスをアンロックする。PixelはGoogleがゼロから開発したスマホで、台湾HTCが製造する。AppleのようにGoogleがスマホ全体を開発して製品を販売する。

PixelはAIスマートフォン

Pixelは最新基本ソフト「Android 7.1」を搭載し、そこには会話型AI「Assistant」が組み込まれている。AssistantはApple Siriに相当する機能で、言葉で指示するとコンシェルジュのように応えてくれる。AIがスマホ機能の中心となり、Pixelはソフトウェアと人工知能の交点として位置づけられる。

ハードウェアの完成度が格段に向上

Pixelはハードウェアとしての完成度が格段に向上した。iPhoneのような形状となり、薄くて軽くて快適に使える。Nexusシリーズと比較すると数世代分を一気に成長した感がある。ディスプレはAMOLEDでカメラは12.3MPの解像度とf/2.0の口径を持つ。Pixelカメラは「Software-Defined Camera」と呼ばれ、ソフトウェアが驚くほどきれいな画像を創りだす。Pixelカメラの性能はiPhone 7を超えたと評価されている。

Assistantが会話を通して生活をサポート

PixelはAIスマホとして位置づけられ、Assistantはコンシェルジュのように会話を通して生活をサポートする。Pixelに対し「Ok Google」と語り掛けるとAssistantが立ち上がり、これに続く言葉を認識する。「When does the San Francisco Moma close」と質問すると、「Moma is open now, it closes at 5 pm」と答える。美術館は5時に閉館するのでまだ開いていることが分かる (下の写真左側)。Assistantは声を聞き分ける生体認証機能があり、筆者のPixelに対して他人が「Ok Google」と呼びかけれも反応しない。

出典: VentureClef

Assistantで撮影した写真を探す

Assistantは写真検索で威力を発揮する。「Show me my photos in the rain」と指示すれば、雨の日に撮影した写真を表示する (上の写真中央上段)。「Show me my pictures taken at Google campus」と指示すると、Googoleキャンパスで撮影した写真を表示する (上の写真中央下段)。音声で操作できるのでスマホでサクサク検索できる。Pixelで撮影した写真はオリジナルサイズで写真アルバム「Google Photos」に格納される。ストレージ容量の制限は無く何枚でも格納できる。

Assistantでレストランを予約する

Assistantは情報検索だけでなく指示されたタスクを実行する。レストランを予約する時はAssistantと対話しながら場所や時間などを決めていく。最後に確認画面が表示され、Yesと答えるとレストランアプリ「OpenTable」で予約が完了する。電話で話すように驚くほど簡単にレストランの予約ができる。また、Assistantは一日のスケジュールを管理する。「What’s next on my calendar」と質問するとAssistantは次の予定を回答する。ここでは予約したレストランの概要が示された (上の写真右側)。

Assistantでアプリを操作する

AssistantはPixelアプリを操作できる。つまり、搭載しているアプリを音声で利用できる。Assistantに「Katy Perry on Instagram」と指示すると、インスタグラムのPerryのページを開く (下の写真左側)。また、「Open Snapchat」と指示すると、スナップチャットが起動してメッセージを読むことができる (下の写真中央)。Assistantに「Play music by Beyoncé」と指示すると、音楽アプリ「Google Music」が起動しビヨンセの音楽を再生する (下の写真右側)。Assistantの音声認識精度は高く、言葉でスマホを操作できるのはとても便利だ。

出典: VentureClef

カメラの性能が業界トップ

Pixelの最大の特長はカメラの性能が業界トップであることだ。カメラの性能は「DxOMark」のベンチマーク指標が使われる。これによるとPixelカメラは89ポイントをマークし、Apple iPhone 7の86ポイントを上回った。今までのトップはSamsung Galaxy S7 Edgeなどで88ポイントをマークしているがPixelがこれを追い越した。DxOMarkはカメラ、レンズ、スマホカメラの性能を評価するサイトでDxO Labs.が運営している。同社は光学関連のソフトウェアやデバイスを開発するフランス企業。

イメージング処理ソフトウェアの威力

Pixelカメラの性能がトップとなった理由はイメージング処理ソフトウェアのアルゴリズムにある。カメラはGoogle独自のハイダイナミックレンジイメージング機能「HDR+」を搭載する。この機能によりダイナミックレンジが広がり、明るい箇所から暗い箇所までバランスよく撮影できる。下の写真はその事例で、厳しい逆光のもとGoogle本社ビルを撮影したもの。肉眼では真っ黒に見えたガラス張りのビルが内部まで写っている。同時に、背後の青空とまぶしい雲がちゃんと写っている。HDR+の威力を感じる一枚となった。

出典: VentureClef

HDRとは

HDR (High Dynamic Range) イメージングとは、異なる露出の複数枚の写真を組み合わせて一枚の写真を生成する技術を指す。一般にHDRは被写体に対して三枚の写真を使う。Underexposure (露出アンダー)、Overexposure (露出オーバー)、及びBalanced (適正露出) の三枚の写真を撮影し、ここから最適な部分を抽出し、これをつなぎ合わせて一枚の写真を生成する。

HDR+とは

これに対してPixelのHDR+は同じ露出の写真を多数枚組み合わせて一枚の写真を生成する。Pixelはカメラアプリを開いた時から撮影を始め、シャッターが押されたポイントを撮りたいシーンと理解する。露出を上げないので暗い部分はノイズが乗ることになる。しかし、暗い部分の写真を数多く重ね合わせることで数学的にノイズを減らす。この手法により、重ね合わせがシンプルになり、ゴーストが発生しないという特徴がある。下の写真はまぶしい雲を背景に星条旗が風にたなびいているが、ゴーストは発生していなく細部まで写っている。

出典: VentureClef

Software-Defined Camera

Pixelカメラは特殊なハードウェア機構は備えていない。Googleはコモディティカメラを使いソフトウェアでイメージング技術を向上させるアプローチを取る。これは「Software-Defined Camera」と呼ばれソフトウェアがカメラの性能や特性を決定する。一眼レフカメラは高価なハードウェアで1枚だけ撮影する。これに対しGoogleは安価なカメラで大量の写真を撮影してソフトウェアで最適化する。イメージング技術はAIを含むアルゴリズムが勝敗を決める。

音声で写真撮影

Pixelカメラは音声で写真を撮影できる。これはAssistantの一部で、フロントカメラで自撮りする時は、「Ok Google, take a selfie」と語るとシャッターが下りる。腕を伸ばして難しい姿勢でシャッターを押す必要はない。メインカメラで写真撮影をするときも、「Ok Google, take a picture」と言えばシャッターが下りる。タイマーを使う代わりに音声で集合写真を撮影できる。メインカメラからフロントカメラに切り替えるときは、Pixelを縦に持ち二回ひねる。

指紋センサー

Pixelをアンロックする時には指紋認証を使う。上述の通りPixelにはホームボタンはなく、背後の指紋センサーに指をかざす。片手で操作でき、かつ、スリープ状態から直接アンロックできるのでとても便利。Pixelは指紋認証の認識率が非常に高く、殆どのケースで1~2回程度でアンロックできる。指紋で認証できないときはPINなど従来方式の認証を行う。

Googleが独自のネットワークを運営

Pixelは米国最大のキャリアVerizonが販売している。また、Google独自のネットワーク「Fi Network」を使うこともできる。Fi NetworkはMVNO (仮想モバイルネットワーク) 方式のネットワークで、背後でSprintとT-Mobile USの4G LTEが使われている。Fi Networkを利用する時は専用のSIM Cardを挿入する。PixelはGoogleオリジナルのスマホをGoogleネットワークで運用する構造となっている。

Fi Networkの特徴

Fi Networkは単に通信網を提供するだけでなく、両者のうち電波強度の強いネットワークに自動で接続する。また、LTEやWiFiなど異なるネットワーク間で最適な通信網を選択し、サービスを途切れなく利用できる。屋内では通話やテキストメッセージはWiFi経由で交信する。屋外に出るとGoogleの移動体ネットワークFi Networkに接続される。

ネットワーク間での自動切換え

このためネットワーク間で途切れなくサービスを利用できる。自宅でWiFi経由で電話している時、屋外に出るとネットワークがLTEに切り替わる (下の写真左側)。通話は途切れることなくシームレスにハンドオーバーされる。通話だけでなくデータ通信でも自動でネットワークが切り替わる。自宅のWiFiでGoogleの音楽ストリーミングを聞きながらクルマで屋外に出るとFi Networkに切り替わる (下の写真中央)。

出典: VentureClef

クルマの中でAssistantが大活躍

クルマの中では言葉でAssistantに指示して好みの音楽を聴ける。電話やメッセージもAssistantに言葉で指示して発信する。ナビゲーションもAssistantに言葉で語り掛けて使う。少し大きめの声で語り掛ける必要はあるが、Assistantは運転中に絶大な威力を発揮する。今ではPixelはドライブに必須のインフォテイメントデバイスとなった。

シンプルで良心的な料金体系

Fi Networkの料金体系はシンプルで基本料金とデータ料金の組み合わせで構成される。基本料金は月額20ドルで、ここに通話、テキストなどが含まれる。データ通信は月額10ドル/GBで、例えば2GBで契約すると月額20ドルとなる。制限量まで使っていない場合は、翌月分の料金から差し引かれる、良心的な料金体系となっている。またデータ通信料はグラフで示され (上の写真右側) 使用量を明確に把握できる。(ロックスクリーン左上にFi Networkと表示される、下の写真左側。アイコンは小さめの円形になりホームスクリーンのデザインがすっきりした、下の写真右側。)

出典: VentureClef

Samsungとの関係は微妙

Googleのモバイル事業はAndroidを開発しこれをパートナー企業に提供することで成り立っている。SamsungなどがAndroidを利用してスマホを販売している。このためスマホ事業はSamsungなどに依存しているだけでなく、Googleの収益構造が問われてきた。事業が拡大するのはSamsungでGoogleは大きな収益を上げることが難しい状態が続いている。GoogleがPixelでスマホ事業に乗り出すことで、Appleのような垂直統合型となり、収益構造も改善すると期待される。一方、Android陣営内でGalaxy顧客がPixelに乗り換えることも予想され、Samsungなどパートナー企業との関係が難しくなる。

ソフトウェア+デバイス+ネットワーク

Googleは基本ソフト (Android) とデバイス (Pixel) だけでなく、ネットワーク (Fi Network) を含めた垂直統合システムでモバイル事業を始めた。Appleのようにスマホを販売するだけでなく、それを運用するネットワークも提供する。キャリアが提供するネットワーク単体では技術進化が停滞している。Googleはデバイスとそれをつなぐネットワークを統合することでイノベーションを起こせるとしている。AIスマホを独自のネットワークで結び、Googleはスマホ事業の近未来の姿を示している。

NvidiaはAI自動運転車を公開、Deep Learningが人間の運転テクニックを模倣する

Nvidiaは半導体製造から自動運転車開発に軸足を移している。NvidiaはAIで構成される自動運転車の試験走行を公開した。Googleなどは自動運転技術の一部をAIで実装するが、NvidiaはこれをすべてDeep Learningで処理する。AI自動運転車は人間の運転を見るだけでドライブテクニックを学ぶ。

出典: Nvidia

自律走行のデモ

Nvidiaは2016年9月、自動運転車が自律走行する模様をビデオで公開した (上の写真、右側手前の車両)。このクルマは「BB8」と命名され、テストコースや市街地で走行試験が実施された。クルマはハイウェーを自動運転で走行できる。ハイウェーは自動運転車にとって走りやすい場所である。しかし、クルマは路面にペイントされている車線が消えているところも自動走行できる。

道路というコンセプトを理解

自動運転車の多くはペイントを頼りにレーンをキープするが、BB8は道路というコンセプトを理解でき、車線が無くても人間のように運転できる。このためBB8は道路が舗装されていない砂利道でも走行できる。路肩は明確ではなく道路の両側には草が生えている。この状況でもクルマは道路の部分を認識して自律的に走行する。

ニュージャージー州で路上試験を展開

クルマは工事現場に差し掛かると、そこに設置されているロードコーンに従って走行する。ドライバーが搭乗しないでクルマが無人で走行するデモも示された。BB8はカリフォルニア州で運転技術を習得した。一方、路上試験は全てニュージャージー州で実施された。クルマは学習した運転技術を異なる州で使うことができることを示した。ちなみにNvidiaはカリフォルニア州では路上試験の認可を受けていない。

Deep Learningを使った運転技術

これに先立ちNvidiaは自動運転技術に関する論文「End to End Learning for Self-Driving Cars」を発表した。この論文でDeep Learningを使った運転技術を示した。自動運転システムは「DAVE-2」と呼ばれ、ニューラルネットワークで構成される。システムはクルマに搭載されているカメラの画像を読み込み、それを解析しステアリングを操作する。

出典: Nvidia

データ入力から出力までをニューラルネットワークで処理

システムの最大の特徴はデータ入力から出力までをニューラルネットワークで処理することだ。カメラのイメージをネットワークが読み込み、それを解析しステアリング操作を出力する。システムが自律的に運転技術を学ぶので、教育プロセスがシンプルになる。カメラで捉えた走行シーンとドライバーのステアリング操作が手本となり、ネットワークがこれを学ぶ。このため、道路に車線がペイントされていなくても人間のように走行できる。また、駐車場で走行路が明示されていなくても、クルマは走ることができる (上の写真)。

ドライバーの運転データを収集して教育

このためドライバーの運転データを収集しネットワークを教育する。具体的には、カメラで撮影したイメージとそれに同期したステアリング操作を収集する。収集した運転データでニューラルネットワークを教育する。ネットワークを構成するConvolutional Neural Network (CNN) にカメラの映像を入力し、ステアリング操作を出力する。この出力を人間のドライバーが運転したときのステアリング操作と比較する。差分を補正することでCNNは人間のドライバーに近づく。

クルマが遭遇するすべての条件を再現

教育データは様々な明るさの状況のもと、また、異なる天候で収集された。データの多くがニュージャージー州で収集された。道路の種別としては二車線道路、路肩にクルマが駐車している生活道路、トンネル内、舗装していない道路が対象となった。気象状況としては、晴れの日だけでなく、雨、霧、雪の条件で走行データが集められた。また、昼間だけでなく夜間の走行データが使われた。つまり、クルマが遭遇するすべての条件が再現された。テスト車両はLincoln MKZとFord Focusが使われた。

車載スーパーコンピューター

教育したネットワークを車載スーパーコンピューター「Drive PX 2」(下の写真)にインストールすると自動運転車が完成する。Drive PX 2は自動運転車向けのAI基盤で自動車メーカーや部品メーカーに提供される。Drive PXはカメラ、Lidar、レーダー、ソナーなどのセンサーで捉えた情報を処理し、クルマ周囲の状況を理解する。これはSensor Fusionと呼ばれ、上述のConvolutional Neural Networkで処理する。ただし、Nvidiaの自動運転車はセンサーとしてカメラだけを使っている。定番技術であるLidarを使わないため、アルゴリズム側で高度な手法が求められる。

出典: Nvidia

アルゴリズムの安全性を確認

システムを教育した後は、路上で試験する前にシミュレータでアルゴリズムを検証する。教育データを入力し、シミュレータでクルマが自動運転できる割合を計算する。このケースでは600秒の運転で10回運転を補正する必要があった。自動運転車がレーンの中心をそれると、仮想ドライバーが元に戻す操作をする。実際の路上試験ではHolmdelからAtlantic Highlands (ニュージャージー州) まで自動運転で走行し、その98%を自動運転モードで運行できた。

AIがルールを学習する

この手法は人間がアルゴリズムに走行のためのルールを教えるのではなく、CNNが画像からそれを読み取る。例えば、CNNはカーブしている道路のイメージを読むと、そこから運転に必要な道路の特徴を把握する (下の写真)。上段がカメラが捉えた画像で、下段がCNNが把握した道路の特徴 (Feature Maps) を示している。CNNは運転に必要な道路の境界部分を捉えていることが分かる。これは人間が教えたものではなくCNNが自律的に学習した成果だ。100時間程度の運転データでCNNを教育すると様々な環境で運転できるようになる。

出典: Mariusz Bojarski et al.

ルールベースの自動運転車

これに対して、自動運転車の多くは画像を解析しルールに従って特徴を抽出する。アルゴリズムは車線ペイントなど道路の特徴や周囲のオブジェクトを把握し、進行経路を計算し、実際にクルマを操作する。これらは事前にプログラムのロジックで定義される。クルマは常に想定外の事象に遭遇するので、それらをIF-THENでプログラミングする。この条件の複雑さ (Curse of Dimensionalityと呼ばれる) が自動運転やロボット開発のネックとなっている。

自動運転技術のロードマップ

Nvidiaの自動運転技術開発は始まったばかりで、次のステップはアルゴリズムの精度を改良する。現在98%を自動運転できるが、この精度を向上させる。また、アルゴリズムの精度をどう検証するかが大きな課題となる。実際に試験運転して精度を測定するだけでなく、これを検証するシステムが必要になる。更にAI自動運転車で問題が発生するとその原因探求が難しい。AIというブラックボックスが周囲の状況を把握し運転する。このため、CNNが把握しているイメージの可視化精度を上げる必要がある。実際にCNNが認識しているイメージを人間が見ることでAIのロジックを理解する。これを手掛かりに問題を解決しアルゴリズムを改良する。

自動運転車はAIアルゴリズムの勝負

NvidiaはDeep Learning向けハードウェアや開発環境を提供する。自動運転車を重点市場としてDrive PXなどをメーカーに提供する。更に、上述のDeep Learningを駆使したソフトウェアも自動運転車開発キットとして提供する。既に80社以上がNvidia技術を使っており、自動運転車のエコシステムが拡大している。多くのメーカーがNvidiaプラットフォームを採用する中、AIアルゴリズムが自動運転市場での勝ち組を決める。

自動運転車のテストコースはビデオゲーム、AIがカーチェイス見て運転テクニックを学ぶ

最新のビデオゲームを見るとシーンが余りにもリアルで写真と区別がつかない。精巧に描写されたビデオゲームを自動運転車開発に利用するアイディアが登場した。長い年月をかけ市街地で走行試験を重ねる代わりに、ビデオゲームに描かれる街中を走りAIアルゴリズムを開発する。

出典: Stephan R. Richter and Vibhav Vineet and Stefan Roth and Vladlen Koltun

インテル研究所などが開発

この技法を開発したのはIntel Labs (インテル研究所) とDarmstadt University (ダルムシュタット大学) で、ビデオゲームを使って自動運転車を教育する。この研究ではビデオゲーム「Grand Theft Auto」が使われた。これは三人組がクルマで市街地を走り犯罪を重ねるビデオゲームで、ここから抽出したフレームでアルゴリズムを教育する。上のグラフィックがその事例で、雨が降る市街地を描写しているが現実世界と区別がつかない。この成果は論文「Playing for Data: Ground Truth from Computer Games」として発表された。

Deep Learningが自動運転技術を支える

自動運転技術開発で成否のカギを握るのがクルマ周囲のオブジェクトを正確に把握する技法だ。自動運転車は搭載しているカメラで周囲を撮影し、そこに何が写っているかを判定する。カメラがクルマの眼となり、乗用車、バス、歩行者、自転車、信号機、歩道、道路などを認識する。AIの一技法であるDeep Learningが自動運転技術を支える。

オブジェクトを識別する方法

AIがビデオからオブジェクトを識別するには二つの手法がある。一つは「Object Detection」と呼ばれ、写真に写っているオブジェクトを箱で囲って示す。オブジェクトの位置と大きさを示すとともに、その区別を表示する。もう一つは「Semantic Segmentation」と呼ばれ、写真の中のオブジェクトをピクセルレベルで表示する。オブジェクトの区別は色分けして示される。

Semantic Segmentationの事例

下の写真がSemantic Segmentationの事例で、左側の写真を処理すると右の側のグラフィックスとなる。道路、自動車、歩行者、建物などのオブジェクトが色分けして示される。前者より高度な技術で、自動運転車は進行方向に何があるのかを理解でき、ナビゲーションの信頼度が大きく向上する。(下の事例はUniversity of Cambridgeの研究成果で、写真をアップロードするとその意味を色分けして表示する。)

出典: VentureClef / University of Cambridge

自動運転技術開発のプロセスと障害

自動運転車が走行する時には、カメラで撮影したイメージを車載システムに入力しリアルタイムで周囲のオブジェクトを把握する。クルマがこの判定をできるようになるためには、事前にアルゴリズムを教育しておく必要がある。教育のためには大量の写真が必要となり、自動運転車は街中を走り回り、走行の様子をビデオで撮影する。次に、撮影された写真に写っているオブジェクトを人間が手作業で名前付けをする。つまり、写真と名前付けされたグラフィックス (上の写真の関係) から成る基準データ (Ground Truth) を整備するという大作業が発生する。これが自動運転車開発で大きな障害となっている。

効率的に教育データを生成する手法

Intel Labsらはこの作業をビデオゲームで行うことで効率的にアルゴリズムを教育する手法を開発した。ビデオゲームから抽出したフレームでSemantic Segmentationする技法である。実際にこの技法を使ってSemantic Segmentation処理をしたものが下のグラフィックスである。入力したフレームは先頭の写真で、色がオブジェクトのクラスを示し、ピクセルレベルで処理されているのが分かる。道路は紫色、建物はレンガ色、空は灰色、乗用車は群青色、トラックは水色、バスは桃色などで示されている。クルマは目の前のオブジェクトの意味が分かり、安全に走行できる経路を見つけ出す。この技法では一枚のイメージを処理する時間は平均で7秒と極めて短いのが特長。

出典: Stephan R. Richter and Vibhav Vineet and Stefan Roth and Vladlen Koltun

ビデオゲームのフレームを大量に使う

この研究ではビデオゲームから25,000枚のフレームが抽出された (下の写真はその一部)。ビデオゲームはロスアンジェルスをモデルにしている。カリフォルニアの太陽が降り注ぐ昼間だけでなく、様々な気象条件のフレームが使われた。雨が降り注ぐ幹線道路や雨上がりの交差点のフレームが使われた。また、霧が立ち込めたシーンなども登場する。

想定しうるすべての環境を学習

幹線道路だけでなく、商店がひしめき合う路地裏の狭い道路のフレームも使われた。更に、一日のうち異なる時間帯のフレームが使われた。夜間にヘッドライトを点けたクルマが行きかうシーンや、夕方に空が赤く染まったフレームなどが使われた。自動運転車にとってはオブジェクトの識別が難しい条件である。人間は初めて走る道路でも運転できるが、アルゴリズムは想定しうるすべての環境を学習する必要がある。

人間との共同作業

システムはイメージをすべて区別できる訳ではない。Semantic Segmentationで色付けできるところと、できないところが混在する。このため専任スタッフがマニュアルで名前付けをする。システムは名前が付けられるとそれを学習し、次のフレームから自分で名前を付けることができるようになる。システムは学習を重ね、オブジェクトを判定し名前付けができるようになる。

ビデオゲームを使った教育技法に大きな期待

アルゴリズムをビデオゲームで教育できることが示された。ただ、ビデオゲームだけで教育するにはまだ制約もある。ビデオゲームのフレームだけでアルゴリズムを教育するとオブジェクトの認識率は43.6%とあまり高くない。そこで、実際に市街地を撮影した写真をミックスして教育すると認識率は65.2%と大きく向上した。写真だけで教育した方法の精度を上回り、ビデオゲームを使った教育技法に大きな期待が寄せられている。

出典: Stephan R. Richter and Vibhav Vineet and Stefan Roth and Vladlen Koltun

フレームだけでなく一連の動きを把握

論文は研究のロードマップについても言及している。今回の成果はビデオで捉えたイメージからオブジェクトを判別する技術「Class-Level Segmentation」を示している。次のステップではフレームを重ね、動画の中でオブジェクトを判定する。更に、オブジェクトの判定だけでなく一連の動きが持つ意味「Instance-Level Segmentation」を抽出する。つまり、路上で自転車を把握するだけでなく、ライダーが右腕を水平に上げると、それは右折するというサインであることを把握する。アルゴリズムは他車や人の行動の意味を理解できるようになる。

AIは犯罪行為を学習するのか

Grand Theft Autoという犯罪を繰り返すアクションゲームで運転技術を学習すると、自動運転車はこの環境にバイアスした認識能力を獲得すると懸念される。クルマが赤信号の交差点を猛スピード横切るシーンが頻繁に登場するが、違法行為をどうフィルタリングするかなどが課題となる。

高度に進化したビデオゲームを利用する

一方、Grand Theft Autoはゲーマーが街のシーンを自由に設定できる。気象条件や時間帯だけでなく、都市部、郊外部、工業地帯など、ゲーム環境を自由に設定できる。クルマが道にあふれるニューヨーク都市部や、霧が立ち込めて運転しにくいサンフランシスコなどを簡単に再現できる。雨が降る街での走行試験のためにKirkland (ワシントン州) に出向く必要はなくなる。高度に進化したビデオゲームが自動運転車のシミュレーション環境として注目されている。