
X'i, Reels'i ya da YouTube Shorts'u bu hafta açtıysanız muhtemelen şu klemlerden birinde durakladınız: çekim ortasında ışığın değiştiği bir ürün reklamı, suyun tam da olması gerektiği gibi aktığı garip biçimde tatmin edici bir fizik klibi, tam kararında bir replik veren bir avatar. Şu anda akışınızı dolduran içeriğin büyük bölümü tek bir araca dayanıyor — Google'ın 19 Mayıs 2026'da I/O etkinliğinde tanıttığı ve bu incelemenin konusu olan video modeli Gemini Omni. Bu kadar hızlı yayılmasının nedenlerinden biri de şu: YouTube Shorts / Create içinde ücretsiz olarak sunuluyor, milyarlarca kullanıcıya ulaşabiliyor ve videoyu şimdiye kadar bu ölçekte görülmemiş bir şekilde düzenliyor — bitmiş bir klibi onunla konuşarak değiştiriyorsunuz. "Geceye çevir." "Dönüp sola doğru yürüsün." "Yağmur ekle." Sıfırdan yeniden üretim yok, zaman çizelgesinde gezinme yok. Bu Gemini Omni incelemesi, o videoların arkasındaki aracı ele alıyor: gerçekte ne olduğu, şu anda insanların onunla neler ürettiği, gerçekten güçlü olduğu yerler, geride kaldığı yerler — ve zamanınıza değip değmeyeceği. Kısası baştan söyleyelim: manşet ham kare kalitesi değil, konuşarak, sahne hafızalı düzenleme — ve Gemini Omni artık Oxava'nın stüdyosunda yayında, yani kaydırmayı bırakıp kendi klibinizi yapabilirsiniz.
Google, Gemini Omni'yi bir "her şeyden her şeye" çok-modlu model olarak konumluyor: metin, görsel, bir ses/konuşma referansı ve video gibi girdilerin bir karışımını kabul ediyor ve şu an için tek tür çıktı üretiyor: video. Bu "şu an" ifadesi önemli. Google, görsel ve ses çıktılarının yol haritasında olduğunu söyledi ama bunlar bugün mevcut değil. Yani "omni" adına ve çok girdili esnekliğine rağmen, bu lansmanda bir görsel ya da müzik modeli değil, bir video üretim modeli. Bunu bir metinden görsele aracıyla karşılaştırıyorsanız, yanlış şeyleri karşılaştırıyorsunuz demektir.
Aile içindeki ilk model Gemini Omni Flash — yüksek hacimli yaratıcı iş için tasarlanmış, hızlı ve maliyet açısından verimli katman. İnsanlar bugün "Gemini Omni" dediğinde neredeyse her zaman Flash'tan bahsediyor.
Pek çok haberde karşınıza çıkacak bir çerçeveleme, Omni'nin "Veo, Genie ve Nano Banana'yı tek bir modelde birleştirdiği" yönünde. Bunu resmi bir spesifikasyon değil, analist özeti olarak değerlendirin — incelemeciler kapsamı açıklamak için bu şekilde tarif ediyor, ama Google'ın kendi çerçevesi daha dar: Omni, Gemini'nin dünya bilgisini fizik ve hareket konusunda daha keskin bir kavrayışla bir araya getiriyor. Bunu neler yapabileceğine dair yararlı bir zihinsel model olarak kullanın, ama Google'ın mimari iddiası gibi alıntılamayın.
Mevcut her video modeli bir klip üretebilir. Gemini Omni'yi ayrıştıran şey, ilk klip oluştuktan sonra olanlar.
Omni, sahnenin bir hafızasını tutuyor — karakterler, nesneler, düzen, ışıklandırma — ve sizin bunları sıfırdan yeniden inşa etmeden, sade dille verilen talimatlarla, birer birer revize etmenizi sağlıyor. "Ona kırmızı bir ceket giydir" dediğinizde, aynı sahnedeki aynı karakter kırmızı bir ceket giyiyor; yüz, kadraj ve arka plan yerinde kalıyor. Ardından "şimdi yavaşça yakınlaştır", sonra "yürüyerek geçen ikinci bir kişi ekle". Her talimat, taze bir zar atışı yerine kalıcı bir sahne üzerinde hedefli bir düzenleme olarak yerine oturuyor.
Bu, çoğu içerik üreticinin bildiği üret-ve-umut döngüsünden gerçekten farklı bir döngü. Devasa bir prompt'u ince ayar yapıp her şeyi yeniden üretmek — değiştirmek istediğiniz o tek detayın beş başka şeyi de sürüklememesini umarak — yerine, sahneye konuşarak yakınsıyorsunuz. Klipler bu yüzden bu kadar iyi yayılıyor: içerik üreticileri, modelin ne çıkardığıyla yetinmek yerine belirli bir fikri sonuna kadar kovalayabiliyor.
Bunun altında Omni'nin gelişmiş fizik sezgisi yatıyor. Google, yerçekimi, kinetik enerji ve akışkan dinamikleri konusunda daha iyi bir kavrayışa vurgu yapıyor, böylece düzenlenmiş hareket daha inandırıcı bir şekilde bir arada duruyor: düşürülen bir nesne ağırlığıyla düşüyor, su su gibi hareket ediyor, bir karakterin momentumu dönüşün içinden taşıyor. Bu fiziksel tutarlılık, düzenlemelerin her seferinde yeni bir halüsinasyon değil, gerçek bir sahne üzerinde yapılmış ayarlar gibi hissettirmesini sağlıyor — ve "bu nasıl yapay zeka olabilir?" tarzı bütün bir klip türünün arkasındaki sır da bu.
Gemini Omni'nin akışınızı bu kadar doldurmasının nedeni spesifikasyon listesi değil — konuşarak-düzenleme döngüsünün insanlara yayınlatabildiği şey. Sayıların büyük bölümünü dört format oluşturuyor ve her birinin kendi versiyonunuzu siz de kurabilirsiniz.
Konuşarak düzenlenen ürün reklamları. Öne çıkan kullanım bu. Bir ürün fotoğrafından başlayın, bir klip üretin, sonra onu minik bir film seti gibi yönetin: "mermer bir tezgahın üstüne koy", "sıcak gün batımı ışığı", "yavaş bir yakınlaşma", "şimdi bir elde göster". Pazarlamacılar, bir prompt'u yirmi kez yeniden render etmek yerine, sahneyi konuşarak şekillendirip cilalı 10 saniyelik spotlar kesiyor. Bir ürününüz mü var? Oxava'da kendi versiyonunuzu deneyin — fotoğraftan başlayın, konuşarak reklama doğru ilerleyin.
Tuhaf biçimde tatmin edici fizik klipleri. Su dökülmesi, kumun çökmesi, domino taşları, ağır çekim sıçramalar — Omni'nin fizik sezgisi bunları gerçek gibi okutuyor, ve "tatmin edici" içerik Shorts ve TikTok'ta saf bir izlenme yakıtı. Hamle, temel hareketi üretip sonra zamanlama ve ışıklandırmayı o hipnotik döngüyü yakalayana kadar talimatla iyileştirmek.
Avatarlar ve konuşan-tarz kısa videolar. Sunucu klipleri, karakter parçaları, sözcü replikleri — kontrol edilebilir, düzenlenebilir karakterler bu formata uyuyor (aşağıdaki rıza uyarısıyla birlikte). İçerik üreticileri, tek bir detayı düzeltmek için tüm üretimi yeniden döndürmek yerine sunumu, kıyafeti ve ortamı konuşarak yeniden şekillendiriyor.
Yeniden karışımlar ve yeniden çerçeveler. Bir sahneyi alıp yeniden kurgulayın — mevsimi, günün saatini, karakterin eylemini değiştirin — tek bir fikri bir seriye dönüştürmek için. Tek bir konseptin nasıl bir yayınlama serisine dönüştüğü tam olarak bu ve sahne hafızasının en çok karşılık verdiği yer burası: bir seferde bir şeyi değiştirirken "dünya" tutarlı kalıyor.
Dürüst not: bunlar bir öne çıkanlar derlemesinde zahmetsiz görünüyor, ama iyi olanlar tek bir şanslı prompt'tan değil, hassas yönlendirmeden geliyor (aşağıda daha fazlası var). İyi tarafı şu ki bu beceri aktarılabilir: tek bir değişikliği net bir şekilde tarif etmekte iyileşin, yukarıdaki her format açılır. Akışı kıskanmak yerine, ilkini stüdyoda yapın.
Bu taze bir lansman olduğu için kesin tavanları bir anlık görüntü olarak değerlendirin — ama işte bilinenler ve nasıl okunması gerektiği.
Netleştirilmesi gereken bir rakam: saniye başına 0,10 dolar rakamı API fiyatlandırması, aylık 7,99 dolar ise tüketici abonelik giriş noktası. Bunlar iki farklı şey — ikisini tek bir "fiyat" olarak karıştırmayın.
Rekabetçi soru "Omni'nin en iyi kareleri var mı?" değil — "konuşarak düzenleme, iş akışınızı üzerine kurmaya değer mi?" İşte dürüst manzara. Ham kare-başı sadakat açısından, bağımsız testçiler Seedance 2.0'ı bir adım önde konumlandırıyor. Omni'nin ayırt edici özelliği düzenleme modeli, kutudan çıkma görsel kalitesi değil.
| Model | Konuşarak düzenleme | Ham kare kalitesi | Klip uzunluğu | Düzenleme modeli |
|---|---|---|---|---|
| Gemini Omni Flash | Var — sahne hafızalı, konuşarak düzenleme | Güçlü (testçiler Seedance'ın hemen gerisine koyuyor) | 10 saniyeye kadar (dağıtım kararı) | Kalıcı bir sahne üzerinde yinelemeli, sade dille düzenlemeler |
| Seedance 2.0 | Yerleşik konuşarak-düzenleme yok | Bağımsız testçiler tarafından en üst sırada | Kısa-form aralık | Yeniden üret / yeniden prompt'la |
| Kling 3.0 | Yerleşik konuşarak-düzenleme yok | Güçlü hareket ve fiziksel gerçekçilik | Kısa-form aralık | Yeniden üret / yeniden prompt'la |
| Veo 3.1 | Sınırlı (prompt odaklı) | Referans düzeyinde sinematik sadakat + yerel ses | Kısa-form aralık | Prompt odaklı, çoğunlukla yeniden üretim |
Adil okuma şu: tek en keskin kareyi istiyorsanız testçilerin işaret ettiği model Seedance 2.0; sinematik kontrol ve yerel ses istiyorsanız Veo 3.1 hâlâ üst sıra bir tercih; hareket gerçekçiliği önceliğinizse Kling 3.0 güçlü. Gemini Omni'nin alanı iyileştirme — yeniden zar atmak yerine konuşarak belirli bir sonuca ulaşmak. Mevcut cephenin daha geniş bir yan yana karşılaştırması için 2026 metinden videoya AI model karşılaştırmamıza bakın. Ses önceliğinizse, tek geçişli ses-açık yaklaşımı ele alan Grok Imagine Video 1.5 incelememiz faydalı bir karşıtlık sunuyor — farklı bahis, farklı güç.
Düzenleme-öncelikli tasarım bazı işlere net biçimde işaret ediyor, bazılarından ise uzaklaştırıyor.
Uygun kullanımlar:
Uygun olmayan kullanımlar:
Özellikle avatarlar için geçerli sorumlu-kullanım notu: sentetik bir kişiyi hassas biçimde yönlendirebildiğiniz için, bunu kendi markanız, lisanslı materyaliniz için kullanın — ve gerçek bir kişinin görüntüsü ya da sesi söz konusuysa yalnızca kayıtlı rıza ile. Kabul etmemiş gerçek insanların ağzına kelime ya da eylem koymayın ve platformunuzun ya da kitlenizin beklediği yerlerde AI üretimi içeriği açıkça belirtin. (Yerleşik SynthID ve C2PA işaretçileri burada yardımcı olur, ama izin almanın yerini tutmaz.)
Gemini Omni etkileyici, ama erken bir aşamada ve birkaç keskin kenarı belirtmekte fayda var — öne çıkanlar derlemesinin es geçtiği kısım burası.
Omni'nin yanında Google, Nano Banana görsel hattının en hızlı, en ucuz modeli olan Nano Banana 2 Lite'ı da piyasaya sürdü — 1.000 görsel başına yaklaşık 0,034 dolara, yaklaşık 4 saniyelik metinden-görsele üretimle. Farklı bir iş için farklı bir araç (video değil, görsel), ama belirtmeye değer: Oxava zaten Nano Banana görsel modellerini kullanıyor, yani platform üzerindeki görsel işinin büyük bölümünü besleyen aile, artık daha hızlı, daha düşük maliyetli bir katmana kavuştu.
İşte pratik kısım: kademeli bir API yayılımını beklemenize — ya da başkalarının kliplerinin viral olmasını izlemeye devam etmenize — gerek yok. Gemini Omni artık Oxava'nın stüdyosunda yayında, görselden videoya ve konuşarak düzenleme iş akışı dahil. Bir durağan görselden başlayın ya da bir klip üretin, sonra onu konuşarak iyileştirin: ışıklandırmayı değiştirin, bir karakteri yeniden kurgulayın, bir öğe ekleyin, hareketi sıkılaştırın — modelin hatırladığı bir sahne üzerinde, bir seferde bir sade-dil talimatıyla. Akışınızı dolduran ürün reklamlarının, fizik kliplerinin ve remixlerin arkasındaki döngü tam olarak bu.
Görsel-öncelikli bir iş akışına doğal olarak oturuyor. Ana görselinizi şekillendirin, canlandırın, sonra konuşarak nihai çekime doğru ilerleyin — görselden videoya iş akışı rehberi tam olarak bu akışın ilk yarısını ele alıyor. Oxava çok-modelli olduğu için de tüm boru hattınızı tek bir lansmana bağlamıyorsunuz: düzenlenebilirlik önemliyse Omni'yi seçin, ham sadakat ya da ses daha önemli olduğunda başka bir modele geçin ve hepsini tek bir yerde tutun.
Omni'nin ne yapıp ne yapmadığı konusunda net olmak gerekirse: bugün video üretiyor ve onu konuşarak düzenliyor. Henüz görsel ya da ses çıktısı vermiyor — bunlar Google'ın yol haritasında, şu anda üründe değil. Şu anda yayında ve gerçekten faydalı olan şey düzenleme döngüsü, ve "videonuzla konuşun" fikrinin neden yalnızca bir demo numarası olmadığını hissetmenin en hızlı yolu bu.
Bu Gemini Omni incelemesinden çıkarılacak sonuç: keşke ben de yapsaydım dediğiniz klipleri kaydırıp geçmeyi bırakın. Stüdyoyu açın ve ilk klibinizi onunla konuşarak düzenleyin.
Gemini Omni, Google'ın 19 Mayıs 2026'da Google I/O'da duyurduğu "her şeyden her şeye" çok-modlu yapay zeka modelidir. Girdi olarak metin, görsel, bir ses/konuşma referansı ve video alır, şu anda çıktı olarak yalnızca video üretir. Öne çıkan özelliği, konuşarak, sahne hafızalı düzenlemedir — bir klibi onunla konuşarak iyileştirirsiniz. Ailenin ilk modeli Gemini Omni Flash'tır.
Henüz değil. Lansmanda Gemini Omni yalnızca video çıktısı veriyor. Google, görsel ve ses çıktılarının yol haritasında olduğunu söyledi, ama bunlar bugün üründe mevcut değil. Çok girdili "omni" adına rağmen, şimdilik bunu bir video modeli olarak düşünün.
İki ayrı fiyat geçerli. Gemini Omni Flash API, üretilen video için saniye başına yaklaşık 0,10 dolara çalışıyor (10 saniyelik bir klip için kabaca 1 dolar). Ayrıca, tüketici erişimi Google'ın giriş seviyesi AI planı üzerinden ayda yaklaşık 7,99 dolardan başlıyor; YouTube Shorts/Create içinde ücretsiz erişim de var. Saniye başına API oranını aylık aboneliği ile karıştırmayın.
Şu anda 10 saniyeye kadar. Google bunu bir model sınırlaması değil, dağıtım kararı olarak tanımlıyor ve tavanın zamanla artmasını bekliyor. Şimdilik, uzun-form bir üretici yerine çekim-çekim bir araç olarak ele almak en doğrusu.
İşe bağlı. Ham kare kalitesinde, bağımsız testçiler Seedance 2.0'ı hafifçe önde konumlandırıyor, Veo 3.1 ise sinematik sadakat ve yerel ses için referans olmaya devam ediyor. Gemini Omni'nin avantajı konuşarak, sahne hafızalı düzenleme — yeniden üretmeden belirli bir sonuca yakınsamak. Tek bir genel kazanan aramak yerine, modeli çekime göre eşleştirin.
Yeni teknikler, model güncellemeleri ve yapay zekâ üretimine dair fikirleri ilk öğrenenlerden ol.