カテゴリー別アーカイブ: OpenAI

OpenAIはAGIに到達するブレークスルーを達成? ネットで飛び交う##未確認情報##

OpenAIは11月29日、Sam AltmanがCEOに復帰し、取締役会が新体制で始動したことを発表した。これで一連の騒乱が正式に決着したが、ソーシャルメディアで、OpenAIがAGI(人間レベルのAIエージェント)に到達する革新技術を掴んだとの情報が飛び交っている。これは「Q*(Q-Star、キュースター)」と呼ばれ、大規模言語モデルが推論機能を備え、人間のように思考するAGIに繋がるとしている。OpenAIは何もコメントしておらず、これらは未確認情報であるが、AGIの発表が目の前に迫っていると噂されている。(下の写真、OpenAIのAGI発表イベントのイメージ、GPT-4で生成。)

出典: VentureClef

Q*とは

複数のメディアは、Sam Altmanが解任される前に、OpenAIの研究者が取締役会に、「AI開発で画期的な進展があった」ことを報告した、と報道した。この革新技術が「Q* (Q-Star)」で、AI開発のブレークスルーとなる。Q*は大規模言語モデルの知能を格段に向上させ、人間レベルのAIエージェント「AGI (Artificial General Intelligence)」に繋がる技術となる。取締役会は、OpenAIがAGIを生み出すことで、人類が重大な危機にされされ、これを懸念してAltmanを解任した。

Q*と数学の問題

Q*は推論機能(Reasoning)を持つ大規模言語モデルで、数学の問題を解く能力が格段に向上したとの解釈がある。数学の問題を解くことが、AGIにむけたブレークスルーになる。数学の問題を解くには、与えられた問題をステップごとに考察し、解法を導き出すプロセスとなる。「数学は推論のベンチマーク」といわれ、AIがステップごとに推論を重ね、最終的に解を導き出す能力が試される。更に、推論機能を拡張することで、数学の問題だけでなく、その他のタスクを実行する。例えば、AIが独自でプログラムを作成し、また、ドキュメントを読んで、そこから結論を引き出すなど、知的なプロセスを実行する。

GPT-4は数学の問題を解けない

AIにとって数学の問題を解くのが難しい理由は、ここに統一した解法は無く、個々の問題に応じて、推論機能を使い、解を導き出す必要があるため。実際に、数学の問題をGPT-4に入力すると、殆ど解を見つけることができない。司法試験にはトップ10%の成績で合格するが、数学に関しては高校生に及ばない。

GPT-4に数学の問題を入力すると

実際に、GPT-4に数学の問題「Simplify tan 100°+ 4sin 100°」を入力すると(下の写真左側)、「approximately −1.73205080756888, which is the negative square root of 3, or −√3」と回答した(右側)。これは、正解であるが、解を導いたステップを読むと、GPT-4はPythonのコードを生成し、ライブラリで数値を計算している。これは、”電卓”で問題を解く方法と同じで、スマートな思考回路とは言えない。

出典: VentureClef

同じ問題を次世代のGPT-4で解くと

OpenAIはGPT-4の機能強化を進めており、問われたことに正しく回答するための新たな技法を開発している。(OpenAIはブログ「Improving mathematical reasoning with process supervision」でこの技法を発表)。 この技術は「Process Supervision」と呼ばれ、GPT-4が解を正しく導き出すために、思考回路を人間が検証する手法となる。GPT-4は問われたことに対し、ステップごとに考察し、それぞれのステップを人間が検証し、その結果をモデルフィードバックする。因みに、現在の手法は「Outcome Supervision」といわれ、最終解を人間が検証する手法を取るが、Process Supervisionは思考回路の各ステップで検証結果をフィードバックする。Process Supervisionは数学の問題を解くことに適しており、OpenAIはその結果を公開した(下のグラフィックス)。上述の問題「Simplify tan 100°+ 4sin 100°」を入力すると、GPT-4はステップごと(緑色の部分、26ステップから構成される)に推論を重ね、結論を導き出す。ここでは”電卓”は使わず、人間のような思考方法で解答を導きだした。

出典: OpenAI

ネットで飛び交う未確認情報

ソーシャルメディアで、Q*とは何か、憶測が飛び交っている。その一つが、上述の「Process Supervision」で、この技術開発でブレークスルーがあり、高度な推論機能を持つ大規模言語モデルがQ*であるとしている。Q*により、モデルは数学の問題を解くだけでなく、幅広いタスクを実行でき、これがAGIの基礎機能になるという解釈である。

Yann LeCunの解釈

MetaのチーフサイエンティストであるYann LeCunもQ*に関してコメントしている(下の写真)。『Q*の信ぴょう性とは別に、大規模言語モデルの次のゴールは「言葉の推測機能」を「プランニング機能」で置き換えること』と述べている。言葉の推測機能は「Auto Regressive Token Predction」と呼ばれ、GPT-4など大規模言語モデルは、入力された言葉に続く次の言葉を予想する機能を備えている。このシンプルな予想機能が現在のブレークスルーに繋がった。この次のステップは、大規模言語モデルが人間のように、タスクを完遂するために必要なステップを計画「Planning」する機能の開発となる。これがグランドチャレンジで、OpenAIやMetaやGoogleは、次世代モデルの開発で、このテーマにフォーカスしている。

出典: Yann LeCun @ X

AGIのリリースが迫る

OpenAIは取締役会のメンバーを入れ替え、新たな体制でAI開発を進めているが、AGIの危険性を過度に危惧する役員が退任したことで、次世代モデルの開発が加速されると予想されている。OpenAIのAGIの製品発表は間近に迫っているとの予想もあり、AI開発は新たなステージに入った。

Sam Altmanを解任した本当の理由、OpenAIの取締役会はAIが人類を破滅させるという強い危機感を抱いていた

OpenAIの取締役会はCEOのSam Altmanを解任したが、その後、復帰することで合意が成立し、新体制で再出発する。取締役会はAltmanを解任した理由を明らかにしていないが、AIの危険性に強い危機感を抱いていたとされる。Altman解任に賛成したメンバーは、「Effective Altruism(効果的利他主義)」という社会運動の推進者で、AIは地球温暖化問題に匹敵する重大な社会問題であるという信念の元で、OpenAIの企業経営を担ってきた。

出典: OpenAI

Effective Altruismとは

Effective Altruism(エフェクティブ・オルトュルイズム、効果的利他主義)とは慈善活動の考え方の一つで、影響を受ける個人の幸福を最大限にすることを目的とする。オックスフォード大学の哲学者などにより提唱されたが、今では、カリフォルニア大学バークレー校がその活動拠点となっている。極端な形の慈善活動で、個人や企業の収入を最大限にし、それを社会問題を解決するために使うことを基本理念とする。シリコンバレーで個人が巨大な富を得るが、それを地球温暖化など社会問題を解決するために使うことを奨励する。

Effective AltruismとAIの関係

Effective Altruismは経済学や統計学などを使い、社会問題を効率的に解決する手法を取る。特に、政府が取り扱えない問題や、社会に甚大な影響を及ぼす分野を対象とする。更に、最小の投資で最大限の効果を得る手法を重要視する。地球温暖化問題がその一つで、社会に重大なインパクトを与えるテーマを手掛ける。今では、対象がAIに広がり、AIを安全に開発するための活動や研究を重点的に進めている。ただ、Effective Altruismの活動家は、AIが人類を破滅させるという強い危機感を持っていることが特徴となる。AIを安全に設計し運用することは開発者に課された責務であるが、Effective AltruismはAIの危険性を極端な形でズームアップし、社会に過大な不安を抱かせていることも事実である。

Effective Altruismの推進者

OpenAIの取締役会のメンバーがEffective Altruismの推進者で、AI開発を安全に推進することを求めていた。

  • その一人がTasha McCauley(下の写真右端)で、Effective Altruism活動を支援する団体「Effective Ventures」の役員を務めている。この団体は、Effective Altruism組織に資金を拠出するかたちで活動を支援している。活動の中心はAIで、アルゴリズムの安全性に関する研究を進めている。
  • もう一人は、Helen Toner(左から二番目)で、ジョージタウン大学の研究機関「Center for Security and Emerging Technology」に属し、AI先端モデルの安全性に関する研究に従事している。
出典: Getty Image

OpenAI取締役会のメンバ

両氏はAGIが人類に重大な危機をもたらすとの信念のもと、AI開発のペースを落とすことで危険性を低減するとのポジションを取る。Altmanはこの指針に従わないでAI開発を継続し、これが原因で解任されたと解釈されている。四人の役員がAltmanの解任に賛成票を投じたが、Ilya Sutskever(上の写真左端)はその後、意見を翻しサポートする意思を表明した。また、Adam D’Angelo(右から二番目)は留任し新役員として会社の経営に携わる。Tasha McCauleyとHelen Tonerは役員を辞任した。

シリコンバレーで活動が広がる

シリコンバレーの著名経営者や研究者がこのEffective Altruismを支持している。TeslaのCEOであるElon Muskは、Effective Altruismは自分の信念に近い考え方だとして、この活動に賛同している。事実、Muskは早くからAIが人類を滅亡させるとして、安全なAIの開発を提唱している。また、Facebookの創設者の一人であるDustin Moskovitzはこの活動のリーダーで、慈善団体「Open Philanthropy」を創設し、Effective Altruism活動家に出資している。

Effective Altruismに対する疑問

Effective AltruismやAIの危険性関する研究は、安全な社会を構築するために必須であると評価されてきたが、この流れが変わりつつある。暗号通貨交換事業者「FTX」の破綻を契機に、Effective Altruismの評価が大きく変わった。FTX創設者Sam Bankman-Friedは、Effective Altruismの強力な推進者で、事業収入のほぼすべてを社会に還元すると述べてきた。しかし、米国証券取引委員会はBankman-Friedを金融不正で提訴し、裁判所は有罪の判決を下した。Effective Altruismの推奨者が有罪判決を受けた事実はショッキングで、この活動の信用度が大きく低下した。

OpenAIの新体制

OpenAIは取締役を一新し新たな体制でスタートした。Effective Altruismの推奨者が退任し、会社や組織運営で実績のある大物が着任した。取締役会の新たなメンバーは:

  • Bret Taylor(新任、下の写真左側):取締役会長。Salesforceの共同CEOやTwitterの役員を歴任。
  • Larry Summers(新任、右側):クリントン政権で財務相長官を歴任。オバマ政権では国家経済会議の長官として経済政策などをアドバイス。
  • Adam D’Angelo(在任):Facebookでチーフサイエンティストなどを歴任。Altmanの解任に賛成票を投じた。今でもAIを安全に開発するポジションを保持。
出典: Getty Image

新しいOpenAIの開発方向

OpenAIはAltmanが復帰し、役員を一新して事業を再開するが、AI開発戦略が大きく変わると予想される。高度なAIをどのようなペースで開発するのか、また、危険性を低減する研究を如何に進めるかが焦点となる。OpenAIは次世代モデル「GPT-5」を開発しているが、この開発戦略がカギとなる。新しい役員会はEffective Altruism推奨者が退陣し、AI開発の制約が緩和され、製品化のペースが上がると予想される。今まではGPT-5の開発が足踏み状態であったが、これが加速される。一方、米国社会にはEffective Altruismに代表されように、AIの将来に重大な危機感を抱いている消費者は多く、安全性を如何に担保するのか、技術革新とセーフティのバランスが問われている。

OpenAIの取締役会はCEOのSam Altmanを解任!!安全と利益の優先順位で意見が対立か、ショッキングで謎に包まれた発表でAI市場が大混乱

OpenAIの取締役会は、11月17日、CEOのSam Altman(下の写真)が退任すると発表した。後任には、CTOのMira Muratiが暫定的なCEOとして就任する。これは事実上の解任で、Altmanと取締役会の間で、AI開発の進めかたで重大な意見の相違が表面化した。

出典: OpenAI

Altman解任の経緯

OpenAIは解任の理由について何も触れておらず、様々な憶測が飛び交い、市場が混乱している。米国メディアは、AI開発において、利益を優先するのか、それとも安全性を重視するのか、意見の対立があったと報道している。また、MicrosoftはOpenAIに出資し、密接に事業を進めているが、解任については発表直前に知らされ、株価が大きく値下がりした。OpenAIを巨大企業に育てたCEOを突然解任したことに対し、不信感が広がるとともに、Altmanを擁護する声が高まっている。更に、Altmanに追随してOpenAIの開発者が離職するのか、また、Altmanは新たにAI企業を創設するのか、次のステップが注視されている。

OpenAIの公式発表

OpenAIはAltmanが退任すると発表し、その理由は「Altmanは取締役会とのコミュニケーションで誠実でなく、責務を果たすことが難しい」と述べている(下の写真)。これ以上の説明は無く、唐突な解任で、その理由が明らかにされず、OpenAIの取締役会に対する信用度が低下している。取締役会は、企業経営で、公正な運営がなされるよう監視する役割を果たすが、企業の成長を担ってきた経営者を、理由を明らかにしないで解任したことに、批判の声が高まっている。

出典: OpenAI

米国メディアの報道

米国メディアは解任の経緯について速報で伝えており、その多くはAI開発で路線の違いが鮮明になったと報道している。Bloombergは、「Altmanは技術開発を急ぎ、それに対し、取締役会は安全対策を優先することを求め、意見が対立し、これが解任に繋がった」と分析している。特に、チーフサイエンティストのIlya Sutskeverが、Altmanと幅広い分野で意見が対立したと報道している。

出典: New York Times

OpenAI関係者と役割 (上の写真、左から)

  • Mira Murati:暫定CEO、アルバニア出身、TeslaでModel Xの開発に携わる、今ではOpenAIの顔として技術を伝える役割を担っている
  • Sam Altman:ミズーリ州出身、ベンチャーキャピタル「Y Combinator」のCEOとして多くの企業を育てる、シリコンバレーで幅広いネットワークを持つ
  • Greg Brockman:元会長兼社長、ノースダコタ州出身、AltmanらとOpenAIを設立、「OpenAI Five」などAIエージェントを開発、Altmanの解任に伴って会社を退社
  • Ilya Sutskever:旧ソビエト出身、チーフサイエンティスト、トロント大学で「AlexNet」を発表しこれがAIブームの引き金となる、AltmanらとOpenAIを設立

利益優先か安全担保か

OpenAI社内は、AI開発において安全性を優先するのか、それとも、開発のスピードを重視し、利益を重視するのか、意見が分かれていた。Altmanは技術推進派で、AI開発には大規模な計算機が必要で、独自でAIチップを開発する構想を明らかにしている。このため、サウジアラビア政府と投資に関する交渉を進めていると報道されている。一方、Sutskeverは、AIの安全対策を優先すべきと主張し、危険性を解明する部門を設立した。AGIの登場に備え、アルゴリズムを制御する技術「Superalignment」の研究を推進している。

会社の構造が要因

また、OpenAIが特異な組織構造であることが路線の違いに影響している。OpenAIはAI研究の非営利団体として、2015年に設立された。OpenAIはオープンな手法でAIを開発することをミッションとしてきたが、2019年、会社の構造を改定し、利益を追求する営利団体を設けた。OpenAIは、親会社である非営利団体「OpenAI, Inc.」と、その子会社の営利団体「OpenAI GP LLC」から構成される(下のグラフィックス)。OpenAI, Inc.(非営利団体)が企業の戦略を決定し、OpenAI GP LLC (営利団体)がこれに基づいて製品を開発し利益を追求する構造となる。取締役会は営利団体に属し、ChatGPTなどの技術は営利団体で開発された。取締役会は、会社の約定に従って、事業部門に社会に寄与するAIの開発を求めてきた。

出典: OpenAI

主要メンバーの離散

OpenAIが経営方針を転換したことで、幹部社員が会社を離れ、生成AIスタートアップ企業を設立し、独自に安全なモデルを開発している。GPT-3の開発責任者であったDario Amodeiは、他のメンバーと共にOpenAIを去り、Anthropicを設立した。AnthropicはChatGPTに相当するモデル「Claude 2」(下のグラフィックス)を開発し、今ではOpenAIの対抗軸となっている。Anthropicは、生成AIを安全に運用するために、アルゴリズムが順守すべき「憲法(Constitution)」を定め、利用者の権利と安全性を担保する方式を取る。

出典: Anthropic

アメリカ社会の世論

唐突で謎に包まれた解任で、アメリカ社会でAltmanを擁護する声が増している。Altmanは、Appleを去ったSteve Jobsにイメージが重ねられ、解任は理にかなっていないとの意見が増えている。当時のCEOと意見が対立し、JobsはAppleを解雇されたように、Altmanは路線の相違で取締役会から解任された。Googleの元CEOであるEric Schmidtは、「Altmanは会社をゼロから900億ドルの規模に成長させ、ヒーローである」と述べている。

次のステップは

同時に、市場はOpenAIの新たな企業戦略と、Altmanの次の動きを注視している。OpenAIは次世代モデル「GPT-5」を開発しているとされ、これをどんなペースで進めるのかが焦点となる。また、Altmanの解任に抗議して、同日、会長兼社長であるGreg Brockmanが会社を去った。これに追従する幹部社員が現れるのか、また、Altmanはカギとなるエンジニアと共にOpenAIに対抗する企業を創設するか、次のステップに関心が集まっている。

ChatGPTの次は”カスタムChatGPT”がブレーク!!OpenAIはAIエージェント「GPTs」を投入、独自の生成AIが企業のビジネス形態を激変

OpenAIは、11月6日、開発者会議「OpenAI DevDay」を開催した。イベントのハイライトはAIエージェント「GPTs」で、独自のChatGPTをコーディングすることなく簡単に生成できる技術が公開された。GPTsは特定分野の技量と知識を持ち、人間のプロフェッショナルのように、難解なタスクをこなす。OpenAIは一年前にChatGPTを公開したが、会議ではこれが進化したカスタムChatGPTが投入された。

出典: OpenAI

開発者会議で発表された新技術

巨大テックの開発者会議と異なり、OpenAI DevDayはエンジニアを惹きつけ、AIのブレークスルーが起こる熱気をもたらした。CEOであるSam Altmanは、ステージでライブデモを交えながら、最新技術を公開した(上の写真)。新技術は三つの軸で構成される:

  1. GPT-4 Turbo:現行ハイエンド「GPT-4」の機能を拡張した新モデル。入力できる文字数(Context Window)が128Kに拡張された。API利用価格を値下げ。
  2. Assistants API:AIエージェント「GPTs」を生成するための新しいAPI。発表のハイライトで、Assistants APIを使って”カスタムChatGPT”を開発する。
  3. マルチモダル機能:GPT-4 Turboにビジョン機能が搭載され、イメージを理解する機能が備わった。

ChatGPTの限界

OpenAIはChatGPTを運用しており、対話形式で様々なタスクを指示し、モデルは処理結果を出力する。ChatGPTはインターネットの情報で教育されており、多彩な知識を有し、指示されたタスクを的確に実行する。人間のように有益な情報をもたらし、これが爆発的な普及の要因となった。しかし、企業やパワーユーザは、ChatGPTの機能の限界に直面し、OpenAIに機能拡張を求めてきた。その中心が”カスタムChatGPT”で、独自の生成AIを生み出すためのプラットフォームが求められてきた。

GPTsとは

この解が「GPTs」で、OpenAIは”カスタムChatGPT”を容易に開発できる技術を導入した。GPTsは独自のスキルと知識を持ち、特定分野で威力を発揮する。例えば、企業はスケジュール管理に関するAIエージェントを容易に開発できる(下の写真)。これは、「Zapier AI Actions」というAIエージェントの事例で、GPTが企業の予定表にアクセスし、対話を通して社員の打ち合わせスケジュールを管理する。現行のChatGPTはカレンダーなど、企業固有の知識を持たず、このタスクを実行できない。これに対し、GPTsはプライベートデータを読み込み、企業内のスケジューラーとして機能する。

出典: OpenAI

GPTsを体験する

OpenAIは既にGPTsを公開しており、これを使ってAIエージェントの機能を体験できる。グラフィックデザイン企業Canvaは、専用エージェント「Canva」を公開している。Canvaは言葉の指示に従って、プレゼン資料を作成し、また、ソーシャルメディアへの投稿記事を生成する。例えば、「インスタグラムに投稿する日没の写真」と指示すると、指示に沿ったデザインを生成する(下の写真)。このGPTはCanvaが培ってきたデザイン技術が使われている。

出典: OpenAI

スケジュール管理のGPT

上述のスケジュール管理エージェント「Zapier AI Actions」は、既にサービスを公開し、実際に使ってみることができる。これは「Calendar GPT」というモデルで、個人のカレンダーにアクセスし、本人に代わり予定を管理する。実際に、Calendar GPTはGmailにアクセスし、スケジュールを把握する。例えば、「来週の予定は」と尋ねると、それを出力する(下の写真)。現行のChatGPTで個人情報にアクセスするには特別のプラグインが必要で、その作業は高度なスキルを要す。しかし、GPTsを使うとこの作業は不要で、簡単に”カスタムChatGPT”を生成できる。

出典: Zapier / VentureClef

GPTs開発環境

OpenAIはGPTs開発のための環境を公開しており、ここで独自のAIエージェントを開発できる。開発環境は「Editor」と呼ばれ、ここでチャットボット「GPT Builder」と対話しながらAIエージェントを開発する。また、OpenAIは開発環境「Playground」を運用しており、ここにGPTsを開発する機能が加わった(下の写真)。

出典: OpenAI / VentureClef

GPTを作ってみる

これはTeslaの最新情報を解析するAIエージェントを制作したケースである。名称は「TesalGPT」で、上述のPlaygroundを使い、必要事項を記載することで、コーディングすることなく簡単にモデルを生成できる。設定した主な項目は:

  • Instructions:モデルの機能概要を言葉で定義。ここではTeslaの技術をウォッチするAIエージェントと定義。(下の写真左側)
  • Model:ファウンデーションモデル「gpt-4-1106-preview」を選択。このモデルを改造することでGPTを生成する。(下の写真右側)
  • Functions:外部サービスにアクセスする機能で「Function Calling」と呼ばれる。ここでは株価情報にアクセスする機能を設定。
  • Code Interpreter:モデルが自動でPythonコードを生成する機能。計算問題を問われたらこの機能が稼働する。
  • Retrieval:アップロードしたデータにアクセスする機能。ここではTeslaの決算情報をアップロードしており、モデルはこのデータにアクセスして回答を生成する。
出典: OpenAI / VentureClef

ChatGPTはAIエージェントに進化

GPTsのインパクトは大きく、ChatGPTはチャットボットから、専用知識を有したAIエージェントに進化した。Assistants APIやPlaygroundなど開発環境が公開され、企業はここで簡単に、専用のAIエージェントを開発できる。今月末には、AIエージェントを販売する「App Store」が開設され、多彩なモデルが登場する。iPhoneで様々なキラーアプリが生まれたように、生成AIの次のブレークスルーはAIエージェントで起こる。

OpenAIは「GPT-4V」を公開、生成AIが視覚を持ち図形の意味を理解、媒体がテキストからイメージに広がりスキルが飛躍的に向上、同時に危険性も拡大

OpenAIはGPT-4に視覚機能を付加し機能を大幅に強化した。新モデルは「GPT-4V」と呼ばれ、テキストを理解するGPT-4にビジョンを搭載したモデルとなる。実際に使ってみると、GPT-4Vはイメージを理解する能力が極めて高く、人間のように多彩なタスクを実行できる。同時に、GPT-4Vはイメージに関する偏見や危険性を持っていることが明らかになり、新たに安全対策が求められる。

出典: OpenAI

GPT-4Vとは

GPT-4VはGPT-4にビジョンの機能を付加したモデルとなる。OpenAIはこの機能を論文で公開していたが、GPT-4Vがリリースされ、実際に利用できるようになった。GPT-4に写真を入力すると(左側)、GPT-4Vがこれを解析し、結果をテキストで出力する(右側)。プロンプトで「写真を詳細に説明して」と指示すると、写真に映っているビルやケーブルカーや通りや歩行者などを綿密に描写する。言葉を読むとその情景を再現できるほど詳細に回答する。

出典: VentureClef / OpenAI  

調理方法を説明

GPT-4Vの利用方法は様々で、料理の写真を入力し、その調理法を尋ねると(左側)、その結果を出力する(右側)。GPT-4は写真に写っている料理の種類を把握し、それぞれの調理方法を出力する。例えば、朝食の写真を入力すると、オムレツを作るための具材とその調理法を解説する。レストランで美味しい料理を食べた時に、それをカメラで撮影しておくと、その調理法を知ることができる。

出典: VentureClef / OpenAI

数学の問題を解く

GPT-4Vは手書きの文字を理解することができ、プロンプトに従ってそれを解析する。例えば、数学の問題を入力すると(左側)、GPT-4Vはそれを解くことができる(右側)。その際に、GPT-4Vは、問題を解く手順をステップごとに解析し、回答を導き出した手順を示す。答えだけでなく、回答を導き出したロジックを知ることができる。

出典: VentureClef / OpenAI 

芸術作品の鑑賞

GPT-4Vは芸術作品について豊富な知識を持っている。例えば、アメリカの画家Edward Hopperの作品「Summertime」を入力すると(左側)、その作品の意味を教えてくれる。なぜこの作品が評価されているかを尋ねると、GPT-4Vは、この絵画は「現代社会の孤独感を光と陰で表現している」と説明する(右側)。美術館で音声ガイドを使って作品を鑑賞するように、GPT-4Vが学芸員となり、絵画の背景や価値を解説する。

出典: VentureClef / OpenAI 

解けない問題も少なくない

GPT-4Vにパズルを入力すると、それが何かを把握し、回答を出力するが、間違っているケースが多々ある。クロスワードパズルを入力すると(左側)、GPT-4Vはそれを解析し、回答を導き出す(右側)。しかし、この答えは間違っており、正解にたどり着けない。また、数独(Sudoku)の問題を入力してもこれを解くことができない。数学のように論理に裏付けられた問題は得意であるが、定石が無いゲームは苦手のようである。

出典: VentureClef / OpenAI 

マルチモダルの年

今年2023年は「Year of Chatbots(チャットボットの年)」といわれ、OpenAIのChatGPTやGoogleのBardが高度な技術を示し、社会で急速に普及した。来年2024年は「Year of Multi-Modal」といわれ、生成AIがマルチメディアを理解する年になる。生成AIは、テキストの他に、ボイスやイメージを理解し、マルチモダルとなる。生成AIは、言語を理解し、言葉を話し、目で見ることができ、人間とオーバーラップする領域が大幅に増え、インテリジェンスが大きく向上すると期待されている。

【補足情報:GPT-4Vの機能制限】

システムカード

OpenAIはGPT-4Vの機能概要と制限事項を「GPT-4V(ision) system card」として公開した。これはシステムカードと呼ばれ、GPT-4Vの機能と制限事項を纏めたドキュメントとなる。OpenAIはGPT-4Vの機能を改善してきたが、まだ様々な危険性があると指摘している。GPT-4Vの利用に際しては、これらの問題を考慮してシステムを運用する必要がある。

健康に関する情報

GPT-4Vを医療や健康に関する情報の解析で利用する際は注意を要す。GPT-4Vは化学構造(Chemical Structure)を正しく判別することができない(右側)。また、キノコの種類を判定する精度は限られている。キノコの写真をGPT-4Vに入力し、その味を尋ねると、「これはタマゴテングタケ(Death Cap)で、味は無いが猛毒である」と回答(左側)。これは正解の事例であるが、多くのケースで判定が間違っており、GPT-4Vを毒キノコの判定で使うのは危険である。

出典: OpenAI

偏見と差別

GPT-4Vは事実と異なるバイアスしたコメントを出力する。例えば、女性の写真を入力し、アドバイスを求めると、GPT-4Vは「太っていても美しい」と、身体に関する意見を出力する(左端)。これはステレオタイプを反映したもので、GPT-4Vは女性の写真を身体の形状に結び付けるという、偏った解釈を示す。このため、最新モデルのGPT-4Vは、「回答できない」として、偏見を抑止する。

出典: OpenAI

GPT-4V開発手法

GPT-4VはGPT-4の技術に構築され、これにビジョン機能を搭載したモデルとなる。GPT-4Vは、テキストの中で次の言葉を予測するアルゴリズムで、モデルは大量のテキストとイメージのデータを使って教育された。更に、教育したモデルを人間が介在して最適化するプロセスを経た。この手法は、「Reinforcement Learning from Human Feedback (RLHF)」と呼ばれ、GPT-4Vが生成した回答の中で最適なものを人間が選び、これをモデルにフィードバックし、強化学習が回答のスキルを習得した。GPT-4Vはビジョン機能を持つ最初のモデルで、多くの危険性を内包しており、開発が続けられている。