ジェミニの新しいネイティブイメージジェン機能:私の経験

ジェミニの新しいネイティブイメージジェン機能:私の経験

私たちはこの用語を聞いています」ネイティブにマルチモーダル‘AIスペースでは1年以上ですが、企業はこれまでAIモデルの完全なマルチモーダル機能のロックを解除するのが遅かった。 Googleはついに最新の「Gemini 2.0 Flash Experimental」モデルをリリースしました 画像を生成および編集する機能 ネイティブに

さて、あなたは疑問に思うかもしれません、画像生成との大したことは何ですか? AIイメージ生成は、かなり長い間ChatGPTのようなすべての主要なAIチャットボットで利用できます。さて、ChatGptまたはGeminiでAI画像を生成すると、プロンプトはDall-E 3やImagen 3などの特殊な拡散ベースのモデルにルーティングされます。このモデルは画像でトレーニングされ、画像を生成するためにのみ設計されています。それらはメインAIモデルの拡張のようなものであり、その一部ではありません。

ただし、Geminiのような言語ビジョンモデルはネイティブにマルチモーダルです。つまり、テキストと画像の両方を本質的に理解、生成、変更できます。これまで、この機能をユーザーが利用できるようにしたハイテク企業はありませんでした。 Openaiは、2025年にGPT-4Oでネイティブ画像生成機能を実証しましたが、再び、リリースされませんでした。

ネイティブの画像生成で、あなたは得る より良い一貫性 マルチモーダルモデルは、さまざまなモダリティの大きなデータセットでトレーニングされているためです。その結果、このようなモデルは概念をよりよく理解し、より広い世界の知識を示しています。

また読む:

今すぐPhotoshopのAI生成充填ツールの使用方法

画像生成を超えて、単純なプロンプトで画像をシームレスに編集できます。たとえば、画像をアップロードしてモデルにサングラスを追加し、読みやすいテキストを挿入し、オブジェクトを削除するなどを画像に依頼することができます。また、新しいプロンプトごとに画像全体を再生する拡散モデルとは異なり、ネイティブにマルチモーダルモデルは、複数の変更にわたって一貫性を維持します。

Gemini 2.0 Flash Experimentalのネイティブ画像生成

現在、ネイティブの画像生成機能は一般的なユーザーが利用できません。 Gemini 2.0 Flash Experimental Model with Native Image Generationは、GoogleのAIスタジオでのみ利用できます(訪問)無料で。

AI Studioでモデルをプレビューした後、近い将来誰もが使用できるようにGeminiでリリースされます。しかし、私はネイティブの画像生成で新しいジェミニモデルを試しましたが、それは非常にエキサイティングな経験でした。

最初に、ジェミニのネイティブ画像生成機能の一貫性を紹介するための視覚ガイドから始めました。 Geminiに、オムレツの作成方法に関する視覚ガイドを作成し、プロセスの各ステップの画像を生成するように依頼しました。

  • Geminiを使用してオムレツを作るためのビジュアルガイド2
  • geminiを使用してオムレツを作るビジュアルガイド3
  • Geminiを使用してオムレツを作るためのビジュアルガイド4

ご存知のように、結果は不具合のない画像間で非常に一貫しています。ボウルでさえ2番目の画像でも同じです。最後に、1024 x 680解像度で画像をダウンロードできます。これにより、必要なものに関する視覚ガイドを作成できます。

次に、ジェミニに美的テーブルを作成するように頼み、それからセンターカメラの角度からテーブルを表示するように命じました。それは完璧な仕事をしました。その後、ジェミニにテーブルにプレイステーションを追加し、よく見てみるように促しました。繰り返しますが、ジェミニはそれを釘付けにしました。以下に示すように、AIモデルには、その背後にあるミラーにPS5の反映も含まれています。

  • Geminiネイティブを使用してテーブルの画像を作成します
  • Geminiネイティブを使用して、テーブルの画像2を作成します

Gemini 2.0 Flash Experimentalを使用したネイティブ画像編集

ネイティブの画像編集を示すために、ギャラリーから画像をアップロードし、ジェミニ2.0にテーブルからワイングラスを取り外すように依頼しました。それに続いて、私はジェミニにピザにマッシュルームを追加するように言ったが、それは素晴らしい仕事をした。その後、ジェミニにクロワッサンを追加するように促しました。そこには、ジェミニのネイティブマルチモーダル機能のおかげで、AI画像編集が完全に栄光を与えています。

  • ジェミニを使用したピザ画像の編集
  • ジェミニを使用したピザ2画像の編集

次に、私の画像をアップロードし、ジェミニにサングラスを追加してから、Tシャツに「Moyens I/O」テキストを追加するように依頼しました。どちらも非常にうまくいった。

  • Geminiを使用した画像の編集
  • Geminiを使用して別の画像を編集します

最後に、私はジェミニに画像を着色するように頼みましたが、それも本当にうまくいきました。つまり、奇妙な不具合、アーティファクト、または欠落している画像の一部なしで、画像は以前よりも美しくなりました。

ジェミニを使用して画像を色付けします

Geminiの新しいマルチモーダル機能を試すことができるこのようなユースケースがたくさんあります。 Googleは、ネイティブのイメージ生成と編集で称賛に値する仕事をしてきました。その制限をテストするために、今後数週間でより厳密に使用することを計画しています。

ビデオ生成用のVEO 2および特殊な画像生成用のImagen 3のリリース後、Googleは多くの分野でOpenaiを上回っているようです。 AIテキスト生成だけではありません。したがって、ChatGptでトップスポットを取り戻すためにOpenaiが次に何をしているのかを見るのは興味深いでしょう。

私たちの活動を応援してください ❤️

この記事を気に入っていただけたら、今後も質の高いコンテンツを発信し続けられるようチップのご支援をご検討ください。

PayPalでの安全な支払い
関連項目:  舌操作タッチパッド、アクセシビリティ巡り議論を呼ぶ
Moyens I/O のスタッフはあなたをやる気にさせ、テクノロジー、自己啓発、ライフスタイル、そしてあなたを助ける戦略についてのヒントを提供してくれます。