Google, Gemini model ailesi için yeni bir güncellemeyi kullanıma sundu. Güncelleme; görsel, ses ve metin girdilerini birlikte işleyen çoklu modal (multimodal) yeteneklerin genişletilmesine odaklanıyor.
Çoklu modal yeteneklerde genişleme
Yeni sürümde video girdisi üzerinden zaman damgalı analiz yapabilme özelliği öne çıkıyor. Bu, örneğin bir eğitim videosunun belirli bir dakikasındaki içeriği referans alarak soru sorabilmeyi mümkün kılıyor — içerik üreticileri ve e-öğrenme platformları için pratik bir kullanım alanı.
Geliştirici API’sindeki değişiklikler
API tarafında, istek başına maksimum girdi boyutu artırıldı ve fiyatlandırma modelinde girdi/çıktı token’ları için ayrı ölçeklendirme netleştirildi. Mevcut entegrasyonu olan geliştiricilerin, SDK sürümünü güncelleyip yanıt şemasındaki küçük değişiklikleri gözden geçirmesi tavsiye ediliyor.
Rakip modellerle karşılaştırma
Sektördeki diğer büyük oyuncularla karşılaştırıldığında, bu güncellemenin temel farkı uzun video girdisini tek istekte işleyebilme kapasitesi. Metin tabanlı akıl yürütme performansında ise rakip modellerle aradaki fark bu sürümde büyük ölçüde kapanmış görünüyor.
Türkiye pazarı için notlar
Google’ın Türkçe dil desteği bu güncellemeyle birlikte doğal dil anlama tarafında gözle görülür bir iyileşme gösteriyor; özellikle uzun ve karmaşık cümle yapılarında bağlam kaybı önceki sürüme göre azalmış durumda.
Sonuç
Gemini’nin bu güncellemesi, çoklu modal yapay zeka yarışında dikkat çekici bir hamle. Önümüzdeki dönemde geliştirici geri bildirimleri arttıkça konuyu güncel tutacağız.