2024年のトップ10 AI発表:OpenAI GPT-4o、エージェントモデル、推論モデルなど

2024年のトップ10 AI発表:OpenAI GPT-4o、エージェントモデル、推論モデルなど

AI ブームが始まってから正式に 2 周年を迎えましたが、状況は衰えていません。まさにその逆です。生成 AI は、ほとんど圧倒されるようなペースで進歩しており、容赦ないペースで新しいプラットフォーム、メディア、さらにはデバイスにまで拡大しています。

ここでは、2024 年を AI の世界で記念碑的な年にした 10 の発表を紹介します。

おすすめ動画

OpenAI が GPT-4o をリリース

ChatGPT (GPT-3.5 を実行) が 2024 年 11 月に初めて登場したとき、それは基本的に、コンピューター制御の派手な Mad Libs ゲームでした。誤解しないでください。その機能さえ当時は革新的でしたが、生成 AI システムが真に真価を発揮したのは 2024 年 5 月の GPT-4o のリリースでした。

GPT-4o は、テキストと画像の両方を分析および生成する前世代の機能を基盤としており、GPT-4 単独と比較して、より包括的なコンテキストの理解を提供します。これにより、画像キャプションや視覚分析から、グラフ、チャート、画像などのクリエイティブなコンテンツと分析コンテンツの両方の生成に至るまで、あらゆるパフォーマンスが向上します。

高度な音声モードにより、コンピュータは人間のように話すことができます

ChatGPT 高度な音声モード デスクトップ アプリ
OpenAI

9月、OpenAIは、ChatGPT加入者にAdvanced Voice Modeをリリースすることで、同社が人工知能の大手企業である理由を改めて示した。この機能により、ユーザーはプロンプト ウィンドウに質問を入力する必要がなくなり、代わりに他の人と同じように AI と会話できるようになりました。

GPT-4o の人間と同等の応答時間を活用することで、アドバンスト ボイス モードは人間がマシン インテリジェンスと対話する方法を根本的に変え、ユーザーが AI の創造力を最大限に発揮できるように支援しました。

生成 AI がエッジに到達

iPhone 16 Pro で Visual Intelligence を使用すると、ChatGPT の回答が表示されます。
iPhone の視覚知能は、周囲の世界を理解するためにカメラに依存しています。クリスティーン・ロメロ・チャン / モエンズ I/O

ChatGPT が 2024 年にデビューしたとき、ChatGPT は町で唯一の AI であり、ChatGPT.com という 1 か所で利用できました。ああ、2年も経つと何という違いがあるのだろう。最近では、スマートフォンやスマート ホーム デバイスから自動運転車や健康監視ガジェットに至るまで、あらゆるものに生成 AI が使われています。たとえば、ChatGPT は、デスクトップ アプリ、API、モバイル アプリとして、さらには 800 番号経由でも利用できます。 Microsoft は、自社の Copilot+ ラップトップ シリーズに AI を直接統合しました。

もちろん、最も重要な例は Apple Intelligence でしょう。これは最も成功したリリースではなかったかもしれません (多くの機能はまだ待たれています) が、生成 AI の力を可能な限り利用しやすくするという点では、Apple Intelligence ほど重要なものはありません。

現在、Copilot+ PC も Apple Intelligence も、関係企業がおそらくどのように望んでいたのか、特に Microsoft に対してはどのようなことを望んでいたのかを正確に解明していません。しかし、誰もが知っているように、これはほんの始まりにすぎません。

原子力発電の再開

スリーマイル島
星座エネルギー

この年まで、アメリカでは原子力は負ける命題とみなされていた。 1979 年のスリーマイル島事故では、同発電所の主要原子炉の 1 つが部分的にメルトダウンし、有毒な放射性物質が大気中に噴出したため、信頼性が低く安全でないと考えられていました。しかし、現代の大規模言語モデルに必要な電力量が急速に増加しており、地域の電力網に多大なストレスがかかるため、多くの大手 AI 企業がアトムの力を利用したデータセンターの運営に注目しています。

たとえば、アマゾン Talen から原子力を利用した AI データセンターを購入しました 3月には、小型化された自己完結型の製品を取得する契約に署名しました。 小型モジュール型リアクトル (SMR) は 10 月に Energy Northwest から発表されました。マイクロソフトも負けじと、 スリーマイル島自体の生産能力を買収 そして現在、原子炉1号機を稼働状態に戻して発電するために取り組んでいます。

エージェントは生成 AI の次の目玉となる準備ができています

メガネとチャットチャット
マテウス・ベルテッリ / Pexels

結局のところ、収穫逓減の問題に遭遇するまで、大規模な言語モデルを成長させるタスクに投入できるトレーニング データ、力、水には限りがあることがわかりました。 AI 業界は 2024 年にこれを直接経験し、それに応じて、生成 AI エクスペリエンスを当初定義していた大規模な LLM から離れ、エージェントを優先する方向に舵を切り始めました。ユーザーが要求するすべてを実行しようとするのではなく、特定のタスクを実行するように設計された、より小型で応答性の高いモデル。

Anthropic は 10 月に Computer Use と呼ばれるエージェントをデビューさせました。 Microsoftも11月にCopilot Actionsでこれに続き、OpenAIも1月にエージェント機能をリリースする予定だと伝えられている。

推論モデルの台頭

openAI o1 ロゴ
OpenAI

今日の大規模な言語モデルの多くは、できるだけ早く応答を生成することを目的としていますが、多くの場合、精度や正しさが犠牲になります。 OpenAI の o1 推論モデルは、同社が 9 月にプレビューとして、12 月に完全機能モデルとしてリリースしましたが、逆のアプローチを採用しています。応答速度を犠牲にして、与えられた回答の理論的根拠を内部で検証し、回答の正確さと完全性を保証します。できるだけ。

このテクノロジーはまだ一般に完全に受け入れられていませんが (o1 は現在、Plus 層と Pro 層の加入者のみが利用可能です)、大手 AI 企業は独自のバージョンの開発を進めています。 Googleはo1に対する答えを発表した。 Gemini 2.0 フラッシュ思考実験、12月19日、OpenAIは、12月20日の12日間のOpenAIライブストリームイベントで、o3と呼ばれるo1の後継にすでに取り組んでいることを明らかにしました。

AI を活用した検索がインターネット全体に広がる

iPhone 14 Pro で実行される Perplexity AI アプリ。
ジョー・マーリング / モエンズ I/O

生成 AI は最近どこにでもあるようですが、なぜそれをインターネットの最も基本的な機能の 1 つに統合しないのでしょうか? Googleは過去2年間このテクノロジーに取り組み、まず2024年5月に検索生成エクスペリエンスをリリースし、その後今年5月にAI概要機能を公開した。 AI 概要は、ユーザーが検索結果ページの上部に要求する情報の概要を生成します。

Perplexity AI は、そのテクニックをさらに一歩進めたものです。その「回答エンジン」は、ユーザーが要求した情報をインターネット上で検索し、そのデータを一貫した会話型 (および引用された) 応答に合成するため、リンクのリストをクリックする必要が効果的になくなります。常に革新者である OpenAI は、ChatGPT Search と呼ばれるチャットボット用にほぼ同一のシステムを開発し、10 月にデビューさせました。

Anthropic の Artifact が共同革命を開始

赤い背景に Anthropic のロゴ。
人間的

長い形式のクリエイティブなエッセイであれ、コンピューター コードの断片であれ、大きなファイルをチャット ストリーム内で直接生成、分析、編集しようとすると大変な作業になる可能性があり、ドキュメント全体を表示するには際限なく前後にスクロールする必要があります。

6 月にデビューした Anthropic の Artifacts 機能は、メインの会話以外で AI が作成したテキストを表示できる別のプレビュー ウィンドウをユーザーに提供することで、この問題を軽減します。この機能は非常にヒットしたことが判明し、OpenAI もすぐに独自のバージョンでこれに追随しました。

その最新モデルと機能により、今年 Anthropic は OpenAI と Google に対する手強い敵に成長しましたが、それだけでも重要だと感じます。

画像とビデオのジェネレーターがついに指を解明

カメラ コントロールを使用して、あらゆるショットを意図的に演出します。

今日のランウェイ アカデミーでその方法を学びましょう。 pic.twitter.com/vCGMkkhKds

— ランウェイ (@runwayml) 2024 年 11 月 2 日

以前は、AI が生成した画像やビデオを特定することは、被験者が示した付属肢の数を数えるのと同じくらい簡単でした。2 本の腕、2 本の脚、10 本の指を超えるものは明らかに生成されました。 Stable Diffusion 3 のクローネンバーグ風の画像 6月に実証されました。しかし、2024 年が終わりに近づくにつれて、画像やビデオのジェネレーターが出力の品質と生理学的精度の両方を急速に向上させたため、人間が作成したコンテンツと機械が作成したコンテンツを区別することは大幅に困難になりました。

Kling、Gen 3 Alpha、Movie Gen などの AI ビデオ システムは、歪みを最小限に抑え、きめ細かいカメラ制御でフォトリアリスティックなクリップを生成できるようになりました。一方、Midjourney、Dall-E 3、Imagen 3 などは、無数の芸術スタイルにおける驚くべきレベルのリアリズム(そして最小限の幻覚効果)。

そうそう、OpenAI の Sora が 12 月の発表の一環としてついにデビューしました。 AI 生成のビデオ モデルをめぐる争いは激化しており、2024 年には衝撃的な結果をもたらしました。

イーロン・マスク氏が100億ドルを投じて世界最大のAIトレーニングクラスターを構築

テスラサイバーロデオでのイーロン・マスク氏。
モエンズ I/O

xAI は今年、X に直接組み込まれた最新モデルである Grok 2.0 を発表しました。しかし、イーロン・マスクの AI ベンチャーに関するより大きなニュースは、これが将来どこへ向かうのかということです。 2024 年、イーロン マスクはテネシー州メンフィスの郊外で「世界最大のスーパーコンピューター」の構築に着手し、7 月 22 日午前 4 時 20 分に稼働しました。スーパークラスターは 100,000 個の Nvidia H100 GPU で駆動され、xAI の新しいバージョンをトレーニングする任務を負っています。マスク氏が「世界で最も強力なAI」になると主張するGrok生成AIモデル。

マスク氏は2024年だけで資本コストと推論コストに約100億ドルを費やすとみられているが、新年にはスーパーコンピューターに搭載されるGPUの数を倍増させる取り組みを進めていると伝えられている。

私たちの活動を応援してください ❤️

この記事を気に入っていただけたら、今後も質の高いコンテンツを発信し続けられるようチップのご支援をご検討ください。

PayPalでの安全な支払い
関連項目:  ダレン・アロノフスキーのスープAIスタジオ、大型投資家資金調達に成功