カテゴリー別アーカイブ: Google

Googleのチャットボットは人間より会話が上手い!!これからの検索エンジンは対話型AIに向かう

Googleは開発者会議「Google I/O」を開催し講演をライブビデオで配信した。基調講演ではCEOのSundar Pichaiが研究開発の最新成果を幅広く紹介した。話題はAI、検索技術、モバイル、コラボレーション、量子コンピュータ、クリーンエネルギーと多岐にわたった。この中でもAIに重点が置かれ、会話型AIであるチャットボットの研究でブレークスルーを達成した。(下の写真、Pichaiの基調講演。Googleの本社キャンパスに特設会場を設け講演はオンラインで配信された。)

出典: Google

言語モデルの開発

Googleは言葉を理解するAI技法「言語モデル(Language Model)」の研究を重点的に進めてきた。言語モデルの応用範囲は広く、その代表が機械翻訳で、「Google Translate」として幅広く普及している。また、言語モデルはチャットボットの基礎技術となり、AIアシスタント「Google Assistant」で使われている。また、チャットボットは検索技術と密接に関係し、Googleは対話型の検索エンジンの研究を進めている。

雑談できるチャットボット

Googleはチャットボットの研究でブレークスルーを達成した。このチャットボットは「LaMBD (Language Model for Dialogue Applications)」と呼ばれ、人間のように会話する機能を持つ。LaMDAは話題を定めないで会話するモデル(Open-ended Model)で、とりとめのない会話ができることが特徴となる。人間は日々の生活で雑談するが、AIにとってこれは最も難易度が高いタスクとなる。

冥王星との会話

基調講演ではLaMDAが人間と会話するデモが紹介されたが、AIの話のうまさが印象的であった。ここではLaMDAが準惑星である冥王星となり、人間と会話した(下の写真):

人間:冥王星にいくと目の前にどんな光景がひろがるの?

LaMDA:巨大な渓谷や氷河や間欠泉を見ることができるよ

人間:面白そう

LaMDA:行く価値はあるよ。ただ寒いのでコートが必要。

人間:いままでに来訪者はあった?

LaMDA:色々な訪問者があったが、最近では宇宙船New Horizonが来たよ。

出典: Google

LaMDAの会話を聞くと

LaMDAの会話は自然な流れで、不自然さは全く感じなかった。LaMDAは人間と区別がつかないというより、人間より会話が上手いと感じた。LaMDAは事実を正しく把握してそれを伝えるだけでなく、人間の興味を引く技を理解しており、会話に引き込まれた。これは高度な話術で、何げない会話で、人を惹きつける魅力を備えている。

なぜ会話に惹きつけられるのか

PichaiはLaMDAの魅力の手の内を紹介し、高度な会話能力の技術概要を説明した。LaMDAの技量は三つに区分でき、「納得(Sensible)」と「具体性(Specific)」と「事実(Factuality)」となる。納得とは話を聞いて腑に落ちることを意味する。また、具体性とは相手の発言に対し、曖昧な回答をするのではなく、スペシフィックな応答をすることを指す。また、事実とは話の内容が事実に即し正しいことを指す。ただし、デモの内容は成功事例で、上手く話せないことも多く、LaMDAの研究開発は続いている。

言語モデルのアーキテクチャ

Googleはこれまでに高度な言語モデルを開発してきた。その代表が「BERT」で、人間の言葉を理解し、また、人間のように文章を生成する。BERTは「Transformer」というニューラルネットワークで構成される言語モデルで、人間と同等レベルの言語能力を持つ(下のグラフィックス、単語の前後関係と重要度を把握する)。また、OpenAIが開発した高度な言語モデル「GPT-3」もTransformerを使っている。

出典: Google

言語モデルの教育

LaMDAも同様にTransformerをベースとする言語モデルであるが、BERTとは教育方式が異なる。BERTのアルゴリズムはインターネット上のテキストや書籍の文章で教育されたが、LaMDAは人間の会話データで教育された。人間の会話は決まったパターンは無く、そのバリエーションは千差万別であるある。人間の会話は同じルートを通ることはなく(下のグラフィックス)、AIが会話の内容を理解することは極めて難しい。

出典: Google

検索エンジンとチャットボット

Googleがチャットボットを戦略技術と位置付けるには訳がある。いま検索エンジンのアーキテクチャが曲がり角に来ている。Googleの検索エンジンの骨格は「PageRank」で、Larry PageとSergey Brinが1996年にスタンフォード大学で開発した。PageRankは引用される頻度の高いウェブページが重要だと判定するアルゴリズムで、検索結果の順位付けに使われる。このアルゴリズムがGoogleの検索エンジンのベースになっているが、PageRankの特許は20219年9月に期限が切れている。

対話型検索エンジン

Googleは新しい検索方式としてAIによる対話型を目指している。利用者が検索クエリーを入力すると、AIがその意味や意図を理解して回答をズバリと示す。検索エンジンが数多くのリンクを表示するのに対し、会話形式のAIが人間のように対話しながら回答を示す。Googleは会話型AIとして「Meena」を開発したが、その後継版としてLaMDAを開発した。Googleが高度なチャットボットを開発する理由は検索エンジンをアップグレードするためである。

AIは人間より話が旨い

LaMDAのデモは印象的で、人間のように会話するだけでなく、話の内容が非常に魅力的であった。LaMDAは人間と見分けがつかないだけでなく、人間より話し上手であるとも感じた。話題が興味深く、意外な発見があり、表現力が豊かで、平均的な人間より会話のスキルは高い。これからは、人間と話すよりAIと話すほうが楽しくなるのか、複雑な心境となる。

Googleは今週からオフィスを再開、社員はリモートワークを終了しハイブリッド勤務となる

Googleは4月1日からオフィスを再開し、一部の社員はリモートワークを終え、会社に戻り始めた。9月1日からは全社員がハイブリッド勤務となり、週三日オフィスに出勤する勤務体系となる。社員はワクチン接種が求められ、また、オフィスはリモデルされ、安全を担保しての勤務となる。Facebookは無期限で在宅勤務を続けるが、Googleは人間同士のつながりを重視し、出社勤務が基本パターンとなる。

出典: VentureClef

オフィスを再開

Googleはコロナの感染拡大とともにいち早く勤務形態をリモートワークとしたが、コロナの終息が視野に入る中、他社に先駆けて4月1日にオフィスを再開した。希望する社員はオフィスに出社して勤務できる。オフィスはリモデリングされ、感染防止対策が取られた。また、社員はワクチン接種が求められ、安全を考慮したうえでのオフィス勤務となる。

コロナ後の勤務形態

9月1日からは、新しい勤務体系となり、全ての社員はハイブリッドで仕事をする。週三日が出勤日で、社員は改装されたオフィスに出社して、従来のように対面で仕事をする。これが基本形態で、年間14日を超えて在宅勤務を希望する社員は要望書を会社に提出する。認可されれば在宅勤務を継続できるが、必要に応じて、出社を求めることがあるとしている。コロナ終息後は、Googleはハイブリッド勤務で事業を進めることが明らかになった。(下の写真、建設中の本社ビルで今年中にオープンする予定。また、Googleは本社周辺のオフィスビルの買収を進めている。リモートワークで余った物件を買い進めオフィススペースを拡大中。)

勤務地と給与

ハイブリッド勤務になると居住地についての制限はないが、Googleは社員が住んでいる地域の物価に合わせて給与を調整するとしている。郊外の物価が安い街に住むと生活費の負担が減るが、それに合わせて給与が下がることになる。このため、Googleは多くの社員がシリコンバレーに戻ってくるとみている。まだ在宅勤務が続いているが、シリコンバレーを離れ地方都市で暮らしている社員は少なくない。

出典: VentureClef

出社勤務に戻す理由

Google最高経営責任者Sundar Pichaiは、当初から、リモートワークにおける仕事の効率や生産性について疑問視していた。リモートワークではチームワークの形成が難しく、特に、新製品開発でイノベーションが求められるが、遠隔ではやりにくい。また、在宅勤務では製品情報など社内の機密情報が外部に流出する危険性も含んでいる。このため、Googleは社員を会社勤務に戻すが、柔軟な勤務方式も維持し、週2日は在宅勤務を認める。

社員の勤務形態に関する嗜好

社員はリモートワークに魅力を感じるとともに、在宅勤務では仕事の限界を感じ、オンラインでのコミュニケーションでストレスが蓄積している。完全在宅勤務を選択する社員の割合は少なく、柔軟なワークスタイルを維持できるハイブリッド勤務を求めている。

Facebookなど

一方、FacebookやTwitterなどはコロナが終息しても、無期限で在宅勤務を続けるとしている。希望する社員はオフィス勤務に戻ることができるが、リモートワークが勤務体系の基本パターンとなる。また、社員は居住地を自由に選ぶことができ、環境がいい郊外に引っ越しできる。Facebookの狙いは人事採用にあり、リモートワークに移行することで、北米で幅広く優秀な人材を雇い入れることを目論んでいる。

シリコンバレーから人が流出

このように、社員が居住地を自由に選べるようになり、シリコンバレーから人が流出している。UC BerkeleyとUCLAの研究組織California Policy Labによると、2020年はサンフランシスコから流出する人の数が前年と比べ30%増加した。一方、人口流入はコロナ以前と同じレベルで、結果として、2020年は流出人口が増えた年となった。(下のマップ、2020年第四四半期の人口流出の割合を示している。赤色の部分が人口流出が多い地域。)。

出典: California Policy Lab

ポストコロナの勤務形態

米国はコロナの感染者数が世界最悪のレベルにあるが、バイデン政権になり感染者数が急速に減少し、ワクチン接種が急ピッチで進んでいる。このペースで行くと夏までに国民の大部分がワクチン接種を完了すると予想されている。コロナ終息が視野に入る中、IT企業はオフィスを再開し始めた。多くの企業がハイブリッド勤務を選んでおり、ポストコロナの勤務形態が見えてきた。ただ、ハイブリッド勤務は今までに経験したことのないワークスタイルで、これから各社は試行錯誤しながら最適なモデルを生み出すことになる。

Waymoはサンフランシスコで走行開始、自動運転AIを改良し込み合った市街地を安全に走行

Waymoはサンフランシスコで試験走行を開始することを発表した。社員がWaymoの乗客となり、市街地を走り試験を重ねる。Waymoはアリゾナ州フェニックスでロボタクシー事業を展開している。しかし、サンフランシスコはフェニックスとは異なり、道路は狭くクルマや歩行者で込み合っている。自動運転車にとって最後の難関となる。Waymoは試験走行の後に、サンフランシスコでロボタクシーの事業を開始する。

出典: Waymo

サンフランシスコで試験運転する理由

サンフランシスコは坂の街で、ケーブルカーや路面電車が走行し、観光客が道にあふれる。狭い道路はクルマやバイクやスクーターや歩行者で込み合い、高度な運転スキルが求められる。自動運転車にとって、全米の都市の中で最も高度な技術が求められ、ここが開発の最終ゴールとなる。試験走行はJaguar Land RoverのEVモデル「I-Pace」で行われる(上の写真)。

コンピュータビジョン

複雑な環境で安全に自動走行するために、Waymoは自動運転車の頭脳である「Waymo Drive」を改良した。その一つが、コンピュータビジョンの強化で、クルマは高精度でオブジェクトを認識できるようになった。例えば、カメラは信号が変わるのを長距離で認識できる。ヒスパニックのコミュニティはお祭りには通りに横断幕(Papel Picado)を掲げるが(下の写真)、Waymo Driveは遠方から信号が変わるのを検知し安全に走行する。

出典: Calle 24 Latino Cultural District

推論機能の強化

Waymo Driveの推論機能が強化され、カメラやLidarが捉えたオブジェクトから、動きを予測する能力が向上した。推論とはクルマや歩行者が次に取るアクションを予測するもので、込み合った市街地を走行するには必須の機能となる。特に、Fishermen’s Wharfのような観光地では(下の写真)、歩行者の動きを予測する機能が重要になる。例えば、バスの隣に停止した際は、Waymo Driveはバスから降りた観光客が道路を横切ることを想定して運転する。

出典: VentureClef

道路工事現場を認識

市街地では道路工事により車線が封鎖されることが多いが、Waymo Driveは道路コーンや作業員のハンドシグナルを理解し、現場の指示に従って走行する。Waymo Driveはこれらの情報から新しいルートを計算し、クルマは道路コーンに沿って、工事個所を避けて走行する。

カリフォルニア州で商用運転免許取得

カリフォルニア州で多くの企業が自動運転車の走行試験を実施している。このためにはDMV(Department of Motor Vehicles、州の陸運局)で公道を試験走行するための認可を受ける必要がある。現時点で、55社が自動運転車の走行試験を実施している。更に、自動運転車で営業運転するためには、CPUC(California Public Utilities Commission、公益事業を管轄)で認可を受ける必要がある。商用運転免許を取得してた企業はWaymoの他に、CruiseやZooxなど7社となる。Zooxはサンフランシスコで自動運転車を公開したところで、Waymoの発表はこれに対抗するという狙いもある。

アリゾナでの商用運転

Waymoは2017年からフェニックスでロボタクシー「Waymo One」の実証試験を展開してきた。2020年8月に、これを一般に公開し、今では誰でもWaymo Oneを利用できるようになった。乗客は専用アプリを使い、現在地と目的地を入力しクルマを呼ぶ(下の写真)。Waymo Oneはセイフティドライバーが搭乗しない無人タクシーで、既に10万件の輸送をこなし、安全性について評価が高まっている。

出典: Waymo

2021年は自動運転車の転換点

現在、レベル5の自動運転サービスを提供しているのはWaymoだけである。しかし、Waymo Oneの商用運行はフェニックス市街地に限定されている。今年は、エリアを拡大しサンフランシスコの他に、主要都市での運行が計画されている。更に、Teslaは今年、完全自動運転技術「FSD(Full Self-Driving)」をリリースする。クルマのソフトウェアの更新でこれを実現する。予想外に難航している自動運転車開発であるが、今年は転換の年となる。

タンパク質フォールディングでブレークスルー!!DeepMindはアミノ酸配列からたんぱく質3D構造を予測するAIで50年に渡るチャレンジに解を出す

アミノ酸の配列からタンパク質の3D形状を推定する技法は「タンパク質フォールディング」と呼ばれ、生物学のグランドチャレンジとして、50年にわたり研究が続いてきた。DeepMindは高度なAI「AlphaFold」でこの問題に挑戦し、ついにこれを解くことに成功した。これは生物学の革命と称賛され、医療や製薬が大きく進展すると期待されている。(下の写真:タンパク質フォールディングの事例で、タンパク質の3D形状をイラストで示している。緑色の形状が実測値で、青色の形状がAlphaFoldの予測。)

出典: DeepMind

生物学のグランドチャレンジ

タンパク質はヒトや他の生物を構成する基本単位で、その数は2億種類にのぼる。ヒトは2万種類のタンパク質で構成され、これらが生命の源となる。タンパク質は3D構造が重要で、その形状が機能を決定し、また、他のタンパク質との相互作用を司る。このため、タンパク質は「structure is function」といわれ、その3D構造の解明が続いてきた。しかし、構造を解明できたタンパク質の数はわずかで、3D構造解析が生物学のグランドチャレンジとされてきた。

タンパク質フォールディング

タンパク質はアミノ酸の配列で構成され、ヒトのタンパク質は20種類のアミノ酸で構成される。DNA情報を元にアミノ酸の配列が生成され、それが折り畳まれて3D構造のタンパク質となる。アミノ酸とアミノ酸が結合するとき、両者の距離や結合角度が決まり、らせん配列(Alpha Helix)やシート配列(Pleated Sheet)の構造となる。更に、これらが絡み合い、3D構造のタンパク質ができる。タンパク質がどのように折り畳まれているかを解明する研究を「Protein Folding Problem」と呼び、過去50年にわたり研究が続いてきた。

実験による3D構造の解明

タンパク質の形状を実測するために様々な手法が使われている。主なものは、低温電子顕微鏡法(cryo-electron microscopy)、 核磁気共鳴(nuclear magnetic resonance)、X線回折(X-ray crystallography)などで、実験的手法でその形状を把握する。これらが標準手法(Gold standard)で高精度に形状を把握できるが、測定には時間と経験と費用がかかる。

AlphaFold2の概要

DeepMindはタンパク質の実測に代わり、ニューラルネットワークで形状を推定する研究を進めている。このAIは「AlphaFold」と呼ばれ、アミノ酸の配列からタンパク質の3D形状を推定する。AlphaFoldは既に形状が判明しているタンパク質のデータを使って教育された。AlphaFoldは10万のタンパク質のアミノ酸配列と3D形状を学習し、新たなタンパク質の形状を推定できるようになった。その最新版「AlphaFold2」は高精度に3D形状を推定できる。

出典: DeepMind

タンパク質フォールディングのコミュニティ

DeepMindはタンパク質フォールディングのコミュニティCASP (Critical Assessment of protein Structure Prediction)でずば抜けた性能を示した。CASPはアミノ酸の配列からタンパク質の3D形状を予測するコンペティションで二年ごとに実施される。DeepMindは2018年にはAlphaFoldで、今年は最新モデルAlphaFold2で参戦し、破格の成績を示した(上のグラフ)。

ベンチマーク結果

タンパク質フォールディングの性能はGDT(Global distance test)という指標で示される。これは実験で得られたタンパク質3D構造と予測した3D構造がどれだけ重なるかを査定し、100点満点で示される。AlphaFold2のスコアは90点を超え(上のグラフ右端)、これはタンパク質フォールディングの解を示したと解釈される。つまり、AlphaFold2は実測と同じ精度でタンパク質の3D形状を推定できることを意味する。

新型コロナウイルスの解析

DeepMindはAlphaFoldを新型コロナウイルス(SARS-CoV-2)に応用し治療法の研究に貢献している。新型コロナウイルスは30種類のタンパク質から成り、それらの3D構造の解析が進んでいる。しかし、その中で6種類のタンパク質についてはその形状が分からず、DeepMindはその中の「ORF3a」の形状を特定することに成功した(下の写真)。青色の形状がAlphaFoldによる推定で、緑色の形状がUC Berkeley Brohawn Labによる実測値で、推定結果は実測値に極めて近いことが示された。その後、AlphaFoldはもう一つのタンパク質「ORF8」の3D構造を解明した。

出典: DeepMind

医療への応用

AlphaFoldがタンパク質の3D形状を推定することで、医療技術が大きく進化すると期待されている。その一つが感染症対策で、アフリカなどの途上国で蔓延している感染症「睡眠病(sleeping sickness)」の治療法開発に役立つとされる。睡眠病はツェツェバエが媒介する感染症で、タンパク質の形状が分からないことが病気治療の妨げとなっている。これらは「neglected tropical diseases」と呼ばれ、医療の手が届かず放置された状態の病気で、緊急の対策が求められている。

新薬開発

また、製薬会社はAlphaFoldで分子構造を把握することで、新薬開発が大きく進展すると見ている。新薬開発では複数の候補分子を選び、そこから効果のあるものを絞り込み、完成までに10年の歳月と25億ドルの費用が掛かるとされる。AlphaFoldで病気に関与する人体のタンパク質の形状が分かると、それに効果のある分子を特定でき、新薬開発が大きく進化する。

出典: DeepMind

DeepMindの苦戦と成果

DeepMindは「AlphaGo」を開発し、高度なAIが囲碁の世界チャンピオンを破り、社会に衝撃を与えた。その後、DeepMindは研究開発を進めるが、社会に役立つAIが登場せず、その開発戦略が問われていた。AlphaGoから5年が経過するが、AlphaFoldはタンパク質フォールディングで画期的な成果を示し、今度は社会に役立つAIで世界を驚かせた。(上の写真、AlphaFold開発チーム、今年は在宅勤務で研究を続行。)

もうスパコンは要らない!?AIが物理学を学習し物質の動きをシミュレーション、DeepMindの最新研究成果から

先々週、AI・機械学習の学会International Conference on Machine Learning(ICML)が開催され最新の研究成果が発表された。今年はコロナ感染拡大のためデジタル学会となり、欧米及びアジア諸国の研究者がオンラインで参加し、Zoomで講演する形式となった。

出典: Alvaro Sanchez-Gonzalez et al.

DeepMindの研究概要

この中でDeepMindはAIをシミュレータとして使う技法を発表した。シミュレータは物理現象をグラフィカルに表示する機能を持ち、水槽に水を注ぐと、AIがその動きを予測し、水の動きをビデオで表現する(上の写真右側)。実際の水の動き(上の写真左側)と比べると、複雑な動きをAIが正しく予測していることが分かる。

ニューラルネットワークでシミュレーション

これは「Graph Network-based Simulators」と呼ばれ、ニューラルネットワークでシミュレータを構築する。上の事例は、ニューラルネットワークが水槽に注がれた水の動きを予測したもので、初期条件を入力すると、ニューラルネットワークがその後の動きを計算する。つまり、ニューラルネットワークで水を表現し、それを動かすと、その後の挙動を推測する。

汎用のシミュレータ

Graph Network-based Simulatorsは、水のような液体だけでなく、砂やゼリーなど物理特性の異なる物質の動きを予測できる。水槽に水の塊を落とすと、その後の水の動きを予測する(下の写真上段)。同じニューラルネットワークが、ゼリーの塊を重ねると、それが崩れる動きを計算する(下の写真中段)。また、砂の塊を落とすと、それがタンク内に広がる動きを予測する(下の写真下段)。

出典: Alvaro Sanchez-Gonzalez et al.  

ニューラルネットワークの教育

ニューラルネットワークは実際の物質の動きを見て物理法則を学習する。教育の過程で、物質の動きを1ステップだけ教えると、ニューラルネットワークは数千ステップ先まで予測する。つまり、AIは物理法則を習得し、水槽に水の塊を落とすと、水が波打ちそれが鎮まるまで、遠い先の動きまで予測する。

シミュレーションの規模

更に、少量の物質(例えば水の分子2000個)を使ってニューラルネットワークを構成すると、ネットワークは大量の物質(水の分子85,000個)の動きを予測する。このため、少量の水で流れ方を教えると(下の写真、右上の箱)、ニューラルネットワークは大量の水の流れ方を学習する(下の写真、全体部分)。

出典: Alvaro Sanchez-Gonzalez et al.  

スパコンによるシミュレーション

物理現象のシミュレーションにはスパコンが使われる。スパコンは物質の動きをシミュレーションするために開発されたといっても過言ではない。事実、米国国立研究所Oak Ridge National LabはIBMのスパコン「Summit」を使って様々なシミュレーションを実行している。原子炉内部をスパコンでシミュレーションし、原子炉の耐用期間を延長する研究を展開している。

AIがスパコンを置き換える

スパコンによるシミュレーションで社会は多大な恩恵を受けているが、そのための対価が大きいのも事実である。IBM Summitのコストは2憶ドルといわれ、また、シミュレーショアプリの開発では数多くの研究者が必要となる。これに対し、Graph Network-based Simulatorsは汎用シミュレータで安価なAIプロセッサ(Google Cloud TPU)で動き、幅広い分野に適用できる。今すぐにSummitを置き換えることはできないが、AI開発が進むことでスパコンの一部をニューラルネットワークで代行できると期待されている。

【技術情報:Graph Network-based Simulators】

ニューラルネットワークの構成

Graph Network-based Simulatorsはニューラルネットワークで構成され、ネットワークのニューロンに物質の最小単位(例えば水の分子)を割り当てる。更に、ニューロン間の物理状態(分子の位置や速度、物質の特性、重力など)を指定する。これを実際の物理現象で教育すると、ニューラルネットワークは物質の動きを理解する。完成したニューラルネットワークに初期条件(水槽に水を灌ぐなど)を入力すると、その後の動きを予測する。

ニューラルネットワークの機能

Graph Network-based Simulatorsは物質の分子をEncodeし、これをProcessorで実行し、その結果をDecodeする(下のグラフィックス)。Encodeとは物質の状態(位置や速度や特性など)を凝縮しベクトルで表示する処理を指す。Processorは入力された分子の状態を元に、次の動きを予測する。Processorはこのプロセスを繰り返し、将来の動き(Mステップ先)まで予測する。DecodeとはProcessorの予測結果(ベクトル)を物質の状態に戻す処理をする。

出典: Alvaro Sanchez-Gonzalez et al.  

Message Passingという手法

Graph Network-based Simulatorsは物質の分子をネットワークのニューロンに割り当てるが、これら分子間の相互作用をメッセージ交換(Message Passing)として表現する(下のグラフィックス、中央)。メッセージを交換することで、分子は次の状態に移る。このプロセスを繰り返し分子の動きをMステップ先まで予測する。メッセージは分子の特性(物質の特性や重力など)と隣の分子との相互関係(距離や速度など)で構成される。

出典: Alvaro Sanchez-Gonzalez et al.