ANA SAYFA/BLOG/HABERLER
Haberler

Gemini Omni İncelemesi: Google'ın Konuşarak Düzenlenen Video Modeli

Gemini Omni incelemesi: akışını dolduran AI videoların yarısının arkasındaki araç. Kullanıcılar ne üretiyor, konuşarak düzenleme nasıl çalışıyor, rakiplerle farkı — artık Oxava'da.

Egemen Küpçü2 Temmuz 202612 dk okuma
Gemini Omni İncelemesi: Google'ın Konuşarak Düzenlenen Video Modeli
Paylaş

X'i, Reels'i ya da YouTube Shorts'u bu hafta açtıysanız muhtemelen şu klemlerden birinde durakladınız: çekim ortasında ışığın değiştiği bir ürün reklamı, suyun tam da olması gerektiği gibi aktığı garip biçimde tatmin edici bir fizik klibi, tam kararında bir replik veren bir avatar. Şu anda akışınızı dolduran içeriğin büyük bölümü tek bir araca dayanıyor — Google'ın 19 Mayıs 2026'da I/O etkinliğinde tanıttığı ve bu incelemenin konusu olan video modeli Gemini Omni. Bu kadar hızlı yayılmasının nedenlerinden biri de şu: YouTube Shorts / Create içinde ücretsiz olarak sunuluyor, milyarlarca kullanıcıya ulaşabiliyor ve videoyu şimdiye kadar bu ölçekte görülmemiş bir şekilde düzenliyor — bitmiş bir klibi onunla konuşarak değiştiriyorsunuz. "Geceye çevir." "Dönüp sola doğru yürüsün." "Yağmur ekle." Sıfırdan yeniden üretim yok, zaman çizelgesinde gezinme yok. Bu Gemini Omni incelemesi, o videoların arkasındaki aracı ele alıyor: gerçekte ne olduğu, şu anda insanların onunla neler ürettiği, gerçekten güçlü olduğu yerler, geride kaldığı yerler — ve zamanınıza değip değmeyeceği. Kısası baştan söyleyelim: manşet ham kare kalitesi değil, konuşarak, sahne hafızalı düzenleme — ve Gemini Omni artık Oxava'nın stüdyosunda yayında, yani kaydırmayı bırakıp kendi klibinizi yapabilirsiniz.

Gemini Omni nedir?

Google, Gemini Omni'yi bir "her şeyden her şeye" çok-modlu model olarak konumluyor: metin, görsel, bir ses/konuşma referansı ve video gibi girdilerin bir karışımını kabul ediyor ve şu an için tek tür çıktı üretiyor: video. Bu "şu an" ifadesi önemli. Google, görsel ve ses çıktılarının yol haritasında olduğunu söyledi ama bunlar bugün mevcut değil. Yani "omni" adına ve çok girdili esnekliğine rağmen, bu lansmanda bir görsel ya da müzik modeli değil, bir video üretim modeli. Bunu bir metinden görsele aracıyla karşılaştırıyorsanız, yanlış şeyleri karşılaştırıyorsunuz demektir.

Aile içindeki ilk model Gemini Omni Flash — yüksek hacimli yaratıcı iş için tasarlanmış, hızlı ve maliyet açısından verimli katman. İnsanlar bugün "Gemini Omni" dediğinde neredeyse her zaman Flash'tan bahsediyor.

Pek çok haberde karşınıza çıkacak bir çerçeveleme, Omni'nin "Veo, Genie ve Nano Banana'yı tek bir modelde birleştirdiği" yönünde. Bunu resmi bir spesifikasyon değil, analist özeti olarak değerlendirin — incelemeciler kapsamı açıklamak için bu şekilde tarif ediyor, ama Google'ın kendi çerçevesi daha dar: Omni, Gemini'nin dünya bilgisini fizik ve hareket konusunda daha keskin bir kavrayışla bir araya getiriyor. Bunu neler yapabileceğine dair yararlı bir zihinsel model olarak kullanın, ama Google'ın mimari iddiası gibi alıntılamayın.

Manşet özellik: videoyla konuşarak düzenleme

Mevcut her video modeli bir klip üretebilir. Gemini Omni'yi ayrıştıran şey, ilk klip oluştuktan sonra olanlar.

Omni, sahnenin bir hafızasını tutuyor — karakterler, nesneler, düzen, ışıklandırma — ve sizin bunları sıfırdan yeniden inşa etmeden, sade dille verilen talimatlarla, birer birer revize etmenizi sağlıyor. "Ona kırmızı bir ceket giydir" dediğinizde, aynı sahnedeki aynı karakter kırmızı bir ceket giyiyor; yüz, kadraj ve arka plan yerinde kalıyor. Ardından "şimdi yavaşça yakınlaştır", sonra "yürüyerek geçen ikinci bir kişi ekle". Her talimat, taze bir zar atışı yerine kalıcı bir sahne üzerinde hedefli bir düzenleme olarak yerine oturuyor.

Bu, çoğu içerik üreticinin bildiği üret-ve-umut döngüsünden gerçekten farklı bir döngü. Devasa bir prompt'u ince ayar yapıp her şeyi yeniden üretmek — değiştirmek istediğiniz o tek detayın beş başka şeyi de sürüklememesini umarak — yerine, sahneye konuşarak yakınsıyorsunuz. Klipler bu yüzden bu kadar iyi yayılıyor: içerik üreticileri, modelin ne çıkardığıyla yetinmek yerine belirli bir fikri sonuna kadar kovalayabiliyor.

Bunun altında Omni'nin gelişmiş fizik sezgisi yatıyor. Google, yerçekimi, kinetik enerji ve akışkan dinamikleri konusunda daha iyi bir kavrayışa vurgu yapıyor, böylece düzenlenmiş hareket daha inandırıcı bir şekilde bir arada duruyor: düşürülen bir nesne ağırlığıyla düşüyor, su su gibi hareket ediyor, bir karakterin momentumu dönüşün içinden taşıyor. Bu fiziksel tutarlılık, düzenlemelerin her seferinde yeni bir halüsinasyon değil, gerçek bir sahne üzerinde yapılmış ayarlar gibi hissettirmesini sağlıyor — ve "bu nasıl yapay zeka olabilir?" tarzı bütün bir klip türünün arkasındaki sır da bu.

İnsanlar şu anda onunla gerçekte ne üretiyor

Gemini Omni'nin akışınızı bu kadar doldurmasının nedeni spesifikasyon listesi değil — konuşarak-düzenleme döngüsünün insanlara yayınlatabildiği şey. Sayıların büyük bölümünü dört format oluşturuyor ve her birinin kendi versiyonunuzu siz de kurabilirsiniz.

Konuşarak düzenlenen ürün reklamları. Öne çıkan kullanım bu. Bir ürün fotoğrafından başlayın, bir klip üretin, sonra onu minik bir film seti gibi yönetin: "mermer bir tezgahın üstüne koy", "sıcak gün batımı ışığı", "yavaş bir yakınlaşma", "şimdi bir elde göster". Pazarlamacılar, bir prompt'u yirmi kez yeniden render etmek yerine, sahneyi konuşarak şekillendirip cilalı 10 saniyelik spotlar kesiyor. Bir ürününüz mü var? Oxava'da kendi versiyonunuzu deneyin — fotoğraftan başlayın, konuşarak reklama doğru ilerleyin.

Tuhaf biçimde tatmin edici fizik klipleri. Su dökülmesi, kumun çökmesi, domino taşları, ağır çekim sıçramalar — Omni'nin fizik sezgisi bunları gerçek gibi okutuyor, ve "tatmin edici" içerik Shorts ve TikTok'ta saf bir izlenme yakıtı. Hamle, temel hareketi üretip sonra zamanlama ve ışıklandırmayı o hipnotik döngüyü yakalayana kadar talimatla iyileştirmek.

Avatarlar ve konuşan-tarz kısa videolar. Sunucu klipleri, karakter parçaları, sözcü replikleri — kontrol edilebilir, düzenlenebilir karakterler bu formata uyuyor (aşağıdaki rıza uyarısıyla birlikte). İçerik üreticileri, tek bir detayı düzeltmek için tüm üretimi yeniden döndürmek yerine sunumu, kıyafeti ve ortamı konuşarak yeniden şekillendiriyor.

Yeniden karışımlar ve yeniden çerçeveler. Bir sahneyi alıp yeniden kurgulayın — mevsimi, günün saatini, karakterin eylemini değiştirin — tek bir fikri bir seriye dönüştürmek için. Tek bir konseptin nasıl bir yayınlama serisine dönüştüğü tam olarak bu ve sahne hafızasının en çok karşılık verdiği yer burası: bir seferde bir şeyi değiştirirken "dünya" tutarlı kalıyor.

Dürüst not: bunlar bir öne çıkanlar derlemesinde zahmetsiz görünüyor, ama iyi olanlar tek bir şanslı prompt'tan değil, hassas yönlendirmeden geliyor (aşağıda daha fazlası var). İyi tarafı şu ki bu beceri aktarılabilir: tek bir değişikliği net bir şekilde tarif etmekte iyileşin, yukarıdaki her format açılır. Akışı kıskanmak yerine, ilkini stüdyoda yapın.

Bilmeniz gereken özellikler ve fiyatlandırma

Bu taze bir lansman olduğu için kesin tavanları bir anlık görüntü olarak değerlendirin — ama işte bilinenler ve nasıl okunması gerektiği.

  • Klip uzunluğu: 10 saniyeye kadar. Google, bunun bir model sınırlaması değil, dağıtım kararı olduğunu ve tavanın zamanla yükselmesinin beklendiğini açıkça belirtiyor. Yani 10 saniyeyi kesin bir teknik duvar olarak değil, yayının başlangıç noktası olarak okuyun.
  • Fiyat: saniye başına yaklaşık 0,10 dolar, Gemini Omni Flash API'sinde. 10 saniyelik bir klip kabaca bir dolarlık üretime karşılık geliyor.
  • Filigran: her çıktı hem SynthID hem C2PA kaynak sinyalleri taşıyor — klibin AI tarafından üretildiğini işaretleyen görünmez ve metadata seviyesinde işaretleyiciler. Bu varsayılan olarak açık; dağıtımınız için köken bilgisi önemliyse buna göre planlayın.
  • Erişim: Omni insanlara birkaç kapıdan ulaşıyor. Tüketiciler onu Gemini uygulamasında ve Google Flow'da kullanabiliyor, ayrıca YouTube Shorts / Create içinde ücretsiz olarak sunuluyor. Ücretli tüketici erişimi, Google'ın giriş seviyesi AI planı üzerinden ayda yaklaşık 7,99 dolardan başlıyor. Geliştiriciler için Gemini Omni Flash API, AI Studio ve Gemini API üzerinden genel önizleme olarak yayılıyor — kaynaklar tam zamanlama konusunda hafif farklılık gösteriyor (bazıları şimdi kullanılabilir diyor, bazıları önümüzdeki haftalarda diyor), yani tek seferlik bir açılış tarihi yerine kademeli bir erişim bekleyin.

Netleştirilmesi gereken bir rakam: saniye başına 0,10 dolar rakamı API fiyatlandırması, aylık 7,99 dolar ise tüketici abonelik giriş noktası. Bunlar iki farklı şey — ikisini tek bir "fiyat" olarak karıştırmayın.

Gemini Omni diğer video modelleriyle nasıl karşılaştırılıyor

Rekabetçi soru "Omni'nin en iyi kareleri var mı?" değil — "konuşarak düzenleme, iş akışınızı üzerine kurmaya değer mi?" İşte dürüst manzara. Ham kare-başı sadakat açısından, bağımsız testçiler Seedance 2.0'ı bir adım önde konumlandırıyor. Omni'nin ayırt edici özelliği düzenleme modeli, kutudan çıkma görsel kalitesi değil.

Model Konuşarak düzenleme Ham kare kalitesi Klip uzunluğu Düzenleme modeli
Gemini Omni Flash Var — sahne hafızalı, konuşarak düzenleme Güçlü (testçiler Seedance'ın hemen gerisine koyuyor) 10 saniyeye kadar (dağıtım kararı) Kalıcı bir sahne üzerinde yinelemeli, sade dille düzenlemeler
Seedance 2.0 Yerleşik konuşarak-düzenleme yok Bağımsız testçiler tarafından en üst sırada Kısa-form aralık Yeniden üret / yeniden prompt'la
Kling 3.0 Yerleşik konuşarak-düzenleme yok Güçlü hareket ve fiziksel gerçekçilik Kısa-form aralık Yeniden üret / yeniden prompt'la
Veo 3.1 Sınırlı (prompt odaklı) Referans düzeyinde sinematik sadakat + yerel ses Kısa-form aralık Prompt odaklı, çoğunlukla yeniden üretim

Adil okuma şu: tek en keskin kareyi istiyorsanız testçilerin işaret ettiği model Seedance 2.0; sinematik kontrol ve yerel ses istiyorsanız Veo 3.1 hâlâ üst sıra bir tercih; hareket gerçekçiliği önceliğinizse Kling 3.0 güçlü. Gemini Omni'nin alanı iyileştirme — yeniden zar atmak yerine konuşarak belirli bir sonuca ulaşmak. Mevcut cephenin daha geniş bir yan yana karşılaştırması için 2026 metinden videoya AI model karşılaştırmamıza bakın. Ses önceliğinizse, tek geçişli ses-açık yaklaşımı ele alan Grok Imagine Video 1.5 incelememiz faydalı bir karşıtlık sunuyor — farklı bahis, farklı güç.

Gemini Omni ne için iyi (ve ne için değil)

Düzenleme-öncelikli tasarım bazı işlere net biçimde işaret ediyor, bazılarından ise uzaklaştırıyor.

Uygun kullanımlar:

  • Kısa-form sosyal içerik ve remixler. Shorts, reels ve TikTok'lar hızlı yinelemeyle yaşıyor ve konuşarak düzenleme tam da "bir tık daha" döngüsü için tasarlanmış.
  • Açıklayıcı videolar. Bir senaryoya uyacak şekilde sahneyi adım adım ayarlayın — bir aksesuarı değiştirin, ortamı değiştirin, eylemi yeniden kurgulayın — her seferinde tüm klibi yeniden üretmeden.
  • Avatar ve konuşan-tarz klipler. Aşağıdaki uyarıyla birlikte, kontrol edilebilir, düzenlenebilir karakterler sözcü ve sunucu formatlarına uyuyor.

Uygun olmayan kullanımlar:

  • Uzun-form video. (Şimdilik) 10 saniyelik tavan, Omni'yi iki dakikalık bir sekansı tek seferde render etmenin bir yolu değil, çekim-çekim bir araç yapıyor.
  • Tek seferlik sinematik ana kareler, rakip bir modelin ham sadakat avantajının düzenlenebilirlikten daha önemli olduğu durumlarda.

Özellikle avatarlar için geçerli sorumlu-kullanım notu: sentetik bir kişiyi hassas biçimde yönlendirebildiğiniz için, bunu kendi markanız, lisanslı materyaliniz için kullanın — ve gerçek bir kişinin görüntüsü ya da sesi söz konusuysa yalnızca kayıtlı rıza ile. Kabul etmemiş gerçek insanların ağzına kelime ya da eylem koymayın ve platformunuzun ya da kitlenizin beklediği yerlerde AI üretimi içeriği açıkça belirtin. (Yerleşik SynthID ve C2PA işaretçileri burada yardımcı olur, ama izin almanın yerini tutmaz.)

Devreye girmeden önce bilmeye değer sınırlar

Gemini Omni etkileyici, ama erken bir aşamada ve birkaç keskin kenarı belirtmekte fayda var — öne çıkanlar derlemesinin es geçtiği kısım burası.

  • Düzenleme prompt'ları çok spesifik olmalı. Güçlü düzenlemenin diğer yüzü, belirsiz talimatların aşırı düzenlemeye davetiye çıkarması: gevşek bir istekte modelin amaçladığınızdan daha fazlasını değiştirmesi mümkün. Hassas, seferde-bir-değişiklik yönlendirme ("geri kalan her şeyi koru, yalnızca ceketi kırmızıya çevir") geniş isteklere göre çok daha iyi sonuç veriyor. Prompt hassasiyeti sizin için yeniyse, AI video üreticilerine prompt yazma rehberimiz buraya doğrudan taşınan alışkanlıkları kapsıyor.
  • Video-referans girdisi henüz pürüzlü. Omni kısa bir video referansını (yaklaşık 3 saniyeye kadar) kabul ediyor, ama pratikte henüz düzgün işlenmiyor — buna bağımlı bir iş akışı kurmayın.
  • Karakter tutarlılığı sahne değişimlerinde kayabiliyor. Bir sahne içinde hafıza iyi tutuyor; bir karakteri önemli ölçüde yeni bir sahneye taşıdığınızda tutarlılık kayabiliyor.
  • Henüz yayınlanmış bir benchmark ya da model kartı yok. Kalite iddiaları demolara ve erken elle-tutma raporlarına dayanıyor, resmi değerlendirmeye değil. Karşılaştırmalı sıralamaları geçici olarak değerlendirin.
  • API erişimi hâlâ yayılıyor. Genel önizleme, gelişen parametreler, kapasite kısıtlaması ve haftadan haftaya değişen dokümanlar demek.

Bir şey daha: Nano Banana 2 Lite

Omni'nin yanında Google, Nano Banana görsel hattının en hızlı, en ucuz modeli olan Nano Banana 2 Lite'ı da piyasaya sürdü — 1.000 görsel başına yaklaşık 0,034 dolara, yaklaşık 4 saniyelik metinden-görsele üretimle. Farklı bir iş için farklı bir araç (video değil, görsel), ama belirtmeye değer: Oxava zaten Nano Banana görsel modellerini kullanıyor, yani platform üzerindeki görsel işinin büyük bölümünü besleyen aile, artık daha hızlı, daha düşük maliyetli bir katmana kavuştu.

Gemini Omni İncelemesi: Oxava'da Deneyin

İşte pratik kısım: kademeli bir API yayılımını beklemenize — ya da başkalarının kliplerinin viral olmasını izlemeye devam etmenize — gerek yok. Gemini Omni artık Oxava'nın stüdyosunda yayında, görselden videoya ve konuşarak düzenleme iş akışı dahil. Bir durağan görselden başlayın ya da bir klip üretin, sonra onu konuşarak iyileştirin: ışıklandırmayı değiştirin, bir karakteri yeniden kurgulayın, bir öğe ekleyin, hareketi sıkılaştırın — modelin hatırladığı bir sahne üzerinde, bir seferde bir sade-dil talimatıyla. Akışınızı dolduran ürün reklamlarının, fizik kliplerinin ve remixlerin arkasındaki döngü tam olarak bu.

Görsel-öncelikli bir iş akışına doğal olarak oturuyor. Ana görselinizi şekillendirin, canlandırın, sonra konuşarak nihai çekime doğru ilerleyin — görselden videoya iş akışı rehberi tam olarak bu akışın ilk yarısını ele alıyor. Oxava çok-modelli olduğu için de tüm boru hattınızı tek bir lansmana bağlamıyorsunuz: düzenlenebilirlik önemliyse Omni'yi seçin, ham sadakat ya da ses daha önemli olduğunda başka bir modele geçin ve hepsini tek bir yerde tutun.

Omni'nin ne yapıp ne yapmadığı konusunda net olmak gerekirse: bugün video üretiyor ve onu konuşarak düzenliyor. Henüz görsel ya da ses çıktısı vermiyor — bunlar Google'ın yol haritasında, şu anda üründe değil. Şu anda yayında ve gerçekten faydalı olan şey düzenleme döngüsü, ve "videonuzla konuşun" fikrinin neden yalnızca bir demo numarası olmadığını hissetmenin en hızlı yolu bu.

Bu Gemini Omni incelemesinden çıkarılacak sonuç: keşke ben de yapsaydım dediğiniz klipleri kaydırıp geçmeyi bırakın. Stüdyoyu açın ve ilk klibinizi onunla konuşarak düzenleyin.

Sıkça Sorulan Sorular

Gemini Omni nedir?

Gemini Omni, Google'ın 19 Mayıs 2026'da Google I/O'da duyurduğu "her şeyden her şeye" çok-modlu yapay zeka modelidir. Girdi olarak metin, görsel, bir ses/konuşma referansı ve video alır, şu anda çıktı olarak yalnızca video üretir. Öne çıkan özelliği, konuşarak, sahne hafızalı düzenlemedir — bir klibi onunla konuşarak iyileştirirsiniz. Ailenin ilk modeli Gemini Omni Flash'tır.

Gemini Omni görsel ya da ses üretiyor mu?

Henüz değil. Lansmanda Gemini Omni yalnızca video çıktısı veriyor. Google, görsel ve ses çıktılarının yol haritasında olduğunu söyledi, ama bunlar bugün üründe mevcut değil. Çok girdili "omni" adına rağmen, şimdilik bunu bir video modeli olarak düşünün.

Gemini Omni'nin maliyeti ne kadar?

İki ayrı fiyat geçerli. Gemini Omni Flash API, üretilen video için saniye başına yaklaşık 0,10 dolara çalışıyor (10 saniyelik bir klip için kabaca 1 dolar). Ayrıca, tüketici erişimi Google'ın giriş seviyesi AI planı üzerinden ayda yaklaşık 7,99 dolardan başlıyor; YouTube Shorts/Create içinde ücretsiz erişim de var. Saniye başına API oranını aylık aboneliği ile karıştırmayın.

Gemini Omni klipleri ne kadar uzun olabilir?

Şu anda 10 saniyeye kadar. Google bunu bir model sınırlaması değil, dağıtım kararı olarak tanımlıyor ve tavanın zamanla artmasını bekliyor. Şimdilik, uzun-form bir üretici yerine çekim-çekim bir araç olarak ele almak en doğrusu.

Gemini Omni, Seedance 2.0 ya da Veo 3.1'den daha mı iyi?

İşe bağlı. Ham kare kalitesinde, bağımsız testçiler Seedance 2.0'ı hafifçe önde konumlandırıyor, Veo 3.1 ise sinematik sadakat ve yerel ses için referans olmaya devam ediyor. Gemini Omni'nin avantajı konuşarak, sahne hafızalı düzenleme — yeniden üretmeden belirli bir sonuca yakınsamak. Tek bir genel kazanan aramak yerine, modeli çekime göre eşleştirin.

KURUCU & YAZAR

Egemen Küpçü

Egemen Küpçü, Oxava'nın kurucusu; 3D ve görsel prodüksiyonda 10+ yıl saha deneyimine sahip. Yapay zekâ ile ürün, marka ve kampanya görselleri üretmenin zanaatı üzerine yazıyor.

Bültenimize abone ol

Yeni teknikler, model güncellemeleri ve yapay zekâ üretimine dair fikirleri ilk öğrenenlerden ol.