Gemini 3.7 Flash ile 3.8 Flash arasında ne değişti?
Sürüm farkı yalnızca skor tablosundan ibaret değil. Değişen parametreler, kaynak seviyeleri ve güvenlik notları tek tek ayrılıyor.
Gemini 3.8 Flash, 3.7 Flash'ın mimarisi üzerine kurulan yeni sürümdür. Google, yazılım mühendisliği, ajan tabanlı görevler ve çok adımlı akıl yürütme alanlarında belirgin iyileşme bildiriyor. Değişikliğin merkezinde daha yüksek benchmark skorları, yeniden adlandırılmış düşünme parametresi ve aynı kalan bağlam penceresi var. Güvenlik tarafında ise İngilizce dışındaki dillerde küçük bir gerileme kayda geçmiş.
Farkı doğru okumak için tek bir skor listesine bakmak yetmiyor. Rakamların bir bölümü duyuru metninin gövdesinde, bir bölümü yalnızca grafik görselinde, kalanı da Google'ın başka bir sayfasında yayımlandı. Aşağıdaki bölümler her rakamı kendi kaynak seviyesiyle birlikte veriyor.
Türkçe içeriklerde tekrarlanan bazı ifadelerin resmî karşılığı da yok. Kazanma sayısı veren cümleler, sürüm kadansındaki tarih hataları ve kapalı erişimli modele dair varsayımlar hızla çoğalmış. Yazının ilerleyen bölümlerinde her iddia, dayandığı belge türüyle birlikte ayrıştırılıyor. Doğrulanamayan hiçbir rakam kesin ifadeyle verilmiyor.
Gemini 3.8 Flash hangi temelin üzerine kuruldu?
Yeni sürüm doğrudan Gemini 3.7 Flash temeli üzerine kuruldu. Model kartı ifadeyi açık biçimde yazıyor. Belgeye göre 3.8 Flash, 3.7 Flash üzerine kuruludur. Sıfırdan bir mimari duyurulmadı. Google'ın 2 Eylül 2026 tarihli blog duyurusu modeli "en zeki iş gücü modeli" olarak tanımlıyor.
Sürüm kadansı da farkı anlamaya yardım ediyor. Yeni model, 3.7 Flash'tan yalnızca 3 hafta sonra yayımlandı. Resmî ifadeye göre 6 hafta içindeki üçüncü Flash sürümü oldu. Türkçe içeriklerde geçen "son üç ayda üçüncü Flash" cümlesi yanlıştır.
Eski sürümün emekliye ayrıldığı yorumu da yerinde değil. Duyuru ve geliştirici belgeleri 3.7 Flash'ın "verimlilik önceliğli iş yükleri için tam desteklenmeye devam ettiğini" söylüyor. Hız ve maliyet önceliğiniz varsa eski modelde kalmanız engellenmiyor. Yeni model ise kararlı, yani genel kullanıma açık biçimde yayımlandı.
İkisinin bir arada yaşaması karşılaştırmayı anlamlı kılıyor. Aynı mimari temele oturan iki model, tek bir benchmark setinde ölçülmüş durumda. Değişimin ne kadarının eğitimden, ne kadarının varsayılan düşünme davranışından geldiği ise açıklanmamış. Google iyileşmeyi başlık düzeyinde bildiriyor, ayrıştırılmış bir gerekçe sunmuyor.
İki sürümün teknik künyesi nerede ayrışıyor?
Künyenin büyük kısmı iki sürümde de aynı kaldı. Ayrışma, düşünme parametresinin adlandırılmasında ve model kimliğinde yoğunlaşıyor. Bağlam penceresi 1.048.576 giriş tokenında sabit duruyor, yani yaklaşık 1 milyon token. Azami çıktı ise 65.536 token, yani 64K.
Bilgi kesim tarihi ayrıca dikkat isteyen bir alan. Geliştirici belgeleri kesim tarihini Mart 2026 veriyor. Google'ın model belgeleri ise önemli bir uyarı ekliyor. Bazı alanlarda kullanıcı, bilginin Ocak 2025 ile sınırlı olduğunu görebiliyor. Kesim tarihi, her konu başlığında eşit derinlikte karşılık bulmuyor.
| Alan | Gemini 3.8 Flash için yayımlanan değer |
|---|---|
| Model kimliği | gemini-3.8-flash |
| Yayın aşaması | Genel kullanıma açık, kararlı sürüm, önizleme değil |
| Bağlam penceresi | 1.048.576 giriş tokenı |
| Azami çıktı | 65.536 token (64K) |
| Giriş biçimleri | Metin, görsel, ses, video, PDF |
| Çıktı biçimi | Yalnızca metin |
| Bilgi kesim tarihi | Mart 2026, bazı alanlarda Ocak 2025 sınırı görülebiliyor |
| Düşünme seviyesi | low, medium (varsayılan), high |
| Desteklenmeyen seviye | minimal hata döndürüyor |
| Yok sayılan parametreler | temperature, top_p, top_k |
| Hata veren parametreler | frequency_penalty, presence_penalty, candidate_count |
| Mimari temel | Gemini 3.7 Flash |
Künyedeki en somut kırılma parametre tarafında yaşandı. Eski tam sayılı düşünme bütçesinin yerini üç kademeli seviye ayarı aldı. Örnekleme parametrelerinin yok sayılması da geçiş yapan geliştiriciyi doğrudan etkiliyor. Sıcaklık değerini değiştirip çıktı çeşitliliğini ayarlayan bir kurulum, yeni modelde beklediği davranışı görmeyecek. Dakikalık istek ve token limitleri ise model bazında yayımlanmamış.
Giriş biçimlerinde değişiklik bildirilmedi. Çok modlu alım kapasitesi korunmuş durumda. Model metin, görsel, ses, video ve PDF alıyor, yalnızca metin döndürüyor. Yani girişte yaklaşık 1 milyon tokenlık alan varken, çıkış tarafında 64K sınırı duruyor. Uzun belgeleri tek çağrıda özetleyen akışlarda darboğaz da orada oluşuyor. Karşılaştırma yaparken künye farkını değil, davranış farkını aramanız daha doğru olur.

Karşılaştırma tablosundaki skorlar neyi gösteriyor?
Skorlar iki sürüm arasında tutarlı artış gösteriyor. Ama fark her testte aynı büyüklükte değil. En geniş açılma yazılım mühendisliği tarafında görülüyor. DeepSWE v1.1'de yeni model %73,7, eski model %65,3 alıyor. Akıl yürütme testi HLE-Verified'de ise mesafe küçülüyor, %54,9 karşısında %53,6.
Aşağıdaki tablo, Google'ın yayımladığı karşılaştırma verilerini tek yerde topluyor. Cyber satırları ayrı bir modele, yani kapalı erişimli Gemini 3.8 Flash Cyber'a ait. Model adları da yalnızca Google'ın kendi tablosundan aktarılıyor.
| Benchmark | Gemini 3.8 Flash | Gemini 3.7 Flash | Tabloda anılan diğer modeller |
|---|---|---|---|
| DeepSWE v1.1 | %73,7 | %65,3 | Claude Opus 5 %74,0, GPT-5.6 Sol %72,7 |
| HLE-Verified | %54,9 | %53,6 | Claude Opus 5 %54,4, GPT-5.6 Sol %54,5 |
| Terminal-bench 2.1 | %89,4 | %85,8 | Değer yayımlanmadı |
| CWE-Bench pass@1 (Cyber) | %47,2 | Kapsam dışı | Fable 5 %47,8 |
| CyberGym pass@1, C ve C++ (Cyber) | %86,2 | Kapsam dışı | GPT-5.5-Cyber %85,6, Mythos 5 %83,8, GPT-5.6 Sol %83,6, Gemini 3.5 Flash Cyber %77,5 |
| Dahili açık tespiti, 20 dil (Cyber) | %71,0 | Kapsam dışı | Değer yayımlanmadı |
Tablodaki en dar marj CWE-Bench satırında görülüyor. Yeni Cyber modeli %47,2 alırken karşılaştırılan model %47,8 ile önde kalıyor. Google, kendi modelinin geride kaldığı satırı da yayımlamış oluyor.
Sürüm farkının büyüklüğü teste göre değişiyor. İyileşme her alanda eşit dağılmamış. DeepSWE'deki açılma belirginken, HLE-Verified'de aradaki mesafe çok küçük kalıyor. Ajan tabanlı ve kod odaklı işlerde kazanım hissediliyor, genel akıl yürütme testinde ise sınırlı görünüyor. Rakip modellerle aradaki farklar da çoğu satırda küçük.
Hangi skor duyuru metninde, hangisi yalnızca grafikte?
Ayrım burada işe yarıyor. Skorların yalnızca bir bölümü duyurunun gövde metninde yazıyor. Geri kalanı grafik görselinden okunuyor ya da Google'ın başka bir sayfasında duruyor. Grafikten okunan değerler, metinde cümleyle doğrulanmış değerlerle aynı kanıt ağırlığını taşımıyor.
Somut örnek DeepSWE satırında duruyor. Oradaki %73,7 değeri duyurunun karşılaştırma tablosunda görünüyor, gövde metninde hiç geçmiyor. HLE-Verified'deki %54,9 ise doğrudan metinde yazılı. Dahili açık tespiti testinde metin "%70'i aşıyor" diyor, kesin değer olan %71,0 yalnızca grafikte okunuyor.
| Skor | Değer | Yayımlandığı yer |
|---|---|---|
| HLE-Verified | %54,9 | Duyurunun gövde metninde |
| CWE-Bench pass@1 | %47,2 | Duyurunun gövde metninde |
| Dahili açık tespiti, 20 dil | %71,0 | Metinde "%70'i aşıyor", kesin değer grafikte |
| DeepSWE v1.1 | %73,7 | Yalnızca karşılaştırma grafiğinde |
| CyberGym pass@1 | %86,2 | Yalnızca karşılaştırma grafiğinde |
| Terminal-bench 2.1 | %89,4 ve %90,8 | Lansman tablosu ile Cloud kılavuzu farklı değer veriyor |
| HLE (Verified olmayan) | %45,4 | Yalnızca Google Cloud geliştirici kılavuzunda |
Tabloyu tek başına okumak yeterli. Yine de bir rakamı alıntılayacaksanız önce hangi satırda durduğuna bakın. Gövde metnindeki değerler resmî beyandır, grafikten okunanlar görsel okumaya dayanır.
Ayrımın önemi basit bir nedene dayanıyor. Grafikten okunan değerler zamanla sessizce güncellenebiliyor, arşivlenmesi de zor oluyor. Metne yazılmış bir cümle ise kalıcı kayıt sayılıyor. Teknik değerlendirme yazıyorsanız, iki kategoriyi ayrı ayrı işaretlemeniz sonradan doğrulamayı kolaylaştırır. Pratikte tek satırlık bir not yetiyor. Rakamın yanına "gövde metni" ya da "grafik" yazmak, aylar sonra kaynağa döndüğünüzde iş görüyor. Aynı disiplin, iki sürüm arasındaki farkı abartmadan aktarmanızı da sağlıyor.
"16 testin dokuzunda üstünlük" iddiası kime ait?
İddia Google'a ait değil. Cümle, Türkçe ve yabancı içeriklerde sık tekrarlanıyor ama Google'ın hiçbir kaynağında geçmiyor. Ne duyuruda, ne model kartında, ne de iki metodoloji belgesinde kazanma sayısı veren tek bir satır var. Google hiçbir yerde "şu kadar testin şu kadarında öndeyiz" demiyor.
Sayıyı tablodan doğrulamak da mümkün değil. Yayımlanan karşılaştırmada altı model sütunu var, yani 3.8 Flash, 3.7 Flash ve dört rakip model. Adlandırılmış benchmark sayısı 13, karşılaştırılabilir veri noktası sayısı ise 15. Ortada 16 test yok. İfade, bir teknoloji yayınının kendi sayımı olarak doğmuş ve kaynak gösterilmeden çoğalmış.
Ayrım okur için pratik sonuç doğuruyor. "Google'ın paylaştığı sonuçlara göre" atfı, dayanağı olmayan bir otorite katmanı üretiyor. Skorları değerlendirirken kazanma sayısı yerine tek tek benchmark satırlarına bakmanız daha doğru olur.
Doğru ifade biçimini kurmak da zor değil. Kaç testte önde olduğunu saymak yerine, hangi testte ne kadar fark olduğunu yazmak yeterli oluyor. Kazanma sayısı üreten yorum, ölçüm sayısını ve seçilen alt kümeyi gizliyor. Aynı tablodan başka sayımlar çıkarmak da mümkün. Hangi satırın "test" sayılacağı zaten tanımlı değil.
Benzer yayılma başka ifadelerde de görülüyor. Tarayıcı tarafındaki 2,6 kat bulgusu, kaynağında yalnızca Chrome açıklarıyla ve adı verilmeyen ticari modellerle sınırlı. İkincil aktarımlarda ise genel bir üstünlük iddiasına dönüşmüş. Açığı 2 saatten kısa sürede bulan ekibin adı da kaynakta yazılı, aktarımlarda belirsizleşmiş. Kaynağa dönmek, doğrulamanın en kısa yolu.
Düşünme seviyesi ne işe yarıyor?
Düşünme seviyesi, modelin yanıt üretmeden önce ne kadar akıl yürüteceğini belirleyen ayardır. Parametrenin adı thinking_level ve üç değer alıyor: low, medium, high. Varsayılan kademe medium. Parametre, eski sürümlerdeki tam sayılı thinking_budget alanının yerini almış durumda.
Geliştiricilerin en sık takıldığı nokta minimal değeridir. Değer desteklenmiyor, istek hata döndürüyor. Eski kodunuzda minimal seviye varsa çağrı doğrudan başarısız olur. Ayrıca temperature, top_p ve top_k parametreleri yok sayılıyor, frequency_penalty, presence_penalty ve candidate_count ise hata üretiyor.
| Değer | Durum | Pratik karşılığı |
|---|---|---|
| low | Destekleniyor | Daha az düşünme, daha hızlı yanıt |
| medium | Varsayılan | Hız ile derinlik arasında denge |
| high | Destekleniyor | En derin akıl yürütme, en yüksek gecikme |
| minimal | Desteklenmiyor | İstek hata döndürüyor |
Google'ın kendi uyarısı da burada devreye giriyor. Duyuru ve teknik belgeler, modelin "özellikle yüksek efor seviyelerinde performansı en üst düzeye çıkarmak için daha fazla token" kullanabileceğini söylüyor. Gemini API tarafında ücretlendirme token başına yapıldığından, token tüketimi doğrudan hesaba yansıyor. Aynı görev, yüksek kademede daha fazla token harcayabilir.
Seviye ayarı, iki sürüm arasındaki en görünür davranış farkını da açıklıyor. Yayımlanan skorların hangi kademede alındığı tabloda belirtilmemiş. Kendi testinizde aynı rakamları görmüyorsanız, önce seçili değeri kontrol edin. Varsayılan medium ile high arasındaki gecikme farkı, uzun zincirlerde birikerek büyüyor. Eski sürümden taşınırken de sıra bellidir. Önce minimal değerini temizleyin, sonra hata üreten üç parametreyi çağrıdan çıkarın.
Çok dilli güvenlik performansında ne değişti?
Model kartı, İngilizce dışındaki dillerde güvenlik performansının 3.7 Flash'a göre bir miktar gerilediğini bildiriyor. Not, Türkçe kullanan okuru doğrudan ilgilendiriyor. Genel güvenlik başlığı iyileşirken çok dilli başlık ters yönde hareket etmiş.
Rakamlar puan farkı biçiminde veriliyor. Metin-metin güvenliğinde 0,4 puan iyileşme görülüyor. Çok dilli güvenlikte 5,4 puan gerileme var, gereksiz ret oranı ise 1,1 puan artmış. Model, güvenli bazı istekleri de reddetme eğilimini biraz artırmış.
| Ölçüm | Gemini 3.7 Flash'a göre değişim |
|---|---|
| Metin-metin güvenliği | 0,4 puan iyileşme |
| Çok dilli güvenlik | 5,4 puan gerileme |
| Gereksiz ret oranı | 1,1 puan artış |
Öncü Güvenlik değerlendirmesi de yenilenmemiş. Yayımlanan güvenlik notlarına göre Google yalnızca 3.7 Flash'ı değerlendirmiş, aynı sonucu 3.8 Flash için geçerli saymış. Gerekçe, yeni modelin anlamlı bir yetenek kazanmaması. Cyber modeli için ise yayımlanmış Öncü Güvenlik değerlendirmesi yok.
Türkçe içerik üreten ekip için sonuç net. Sürüm yükseltmesi, İngilizce dışındaki dillerde otomatik iyileşme getirmiyor. Yayımlanan puanlar tersi yönde küçük bir hareket gösteriyor. Önemli akışlarda iki sürümü kendi Türkçe örnekleriniz üzerinde yan yana denemeniz mantıklı olur. Gereksiz ret oranındaki artışı da aynı testte görebilirsiniz.

Google'ın iki resmî sayfası neden farklı rakam veriyor?
Ayrı sayfalar ayrı ölçüm turlarını yansıtıyor gibi görünüyor, ama Google açıklama yapmıyor. Somut olan tek şey şu. Google Cloud geliştirici kılavuzu, lansman tablosundan farklı benchmark değerleri yayımlıyor. Terminal-bench 2.1 için kılavuzda %90,8 ve %81,6 yazıyor. Lansman tablosunda aynı karşılaştırma %89,4 ve %85,8 görünüyor.
Asıl dikkat çeken satır HLE tarafında duruyor. Cloud kılavuzu, Verified olmayan HLE için 3.8 Flash'a %45,4, 3.7 Flash'a %45,7 veriyor. Yeni model burada eski modelin altında kalıyor. Aynı ailenin HLE-Verified sürümünde ise sıralama tersine dönüyor. Tek sayfaya bakarak kurulan yorum eksik kalıyor.
Üçüncü tutarsızlık metodoloji belgesinde saklı. Google o belgede kendi hatasını kabul ediyor. DeepSWE'de rakip modelin skorunu, kamuya açık liderlik tablosundaki yuvarlama yüzünden başlangıçta yanlış bildirmiş. Yayımlanan karşılaştırma tablosu ise düzeltilmemiş, hâlâ eski değeri gösteriyor. CWE-Bench'te karşılaştırılan rakip de duyuruda "bir öncü model" diye anılıyor, DeepMind'ın Fairwind Programı sayfasında ise adıyla veriliyor. Aynı kurum, tek bir karşılaştırmada iki ayrı açıklık düzeyi kullanıyor.
Çelişkiler modelin kalitesini kendiliğinden düşürmüyor, yalnızca tek bir tabloya dayanarak kesin sıralama kurmanın riskini gösteriyor. Sağlıklı yöntem, karşılaştırdığınız iki değerin aynı sayfadan geldiğini doğrulamak. Ayrı sayfalardan alınan rakamları yan yana koymak, ölçüm koşulları eşit olmadığında yanıltıcı sonuç üretir. Google da hangi turun hangi sayfada yayımlandığını açıklamıyor.
Gemini 3.8 Flash Cyber neden herkese açık değil?
Cyber modeli, Google'ın siber güvenlik odaklı ayrı sürümü. Kamuya açık değil. Erişim yalnızca Fairwind Programı üzerinden, Google'ın "güvenilir savunucular" dediği kurumlara veriliyor. Model kimliği, model belgesi, bağlam penceresi ve fiyat hiç yayımlanmadı. Teknik künye tarafında karşılaştırılabilecek veri yok.
Google, kapalılığı ikili kullanım riskiyle açıklıyor. Şirketin açıklamasında "yamalamaya baştan yatırım yaptık ve bunu istismar gibi saldırı yeteneklerinin önüne koyduk" deniyor. Standart 3.8 Flash; kimyasal, biyolojik, radyolojik ve nükleer başlıklarla siber saldırı tarafında kötüye kullanıma karşı korumalarla geliyor. Cyber sürümü daha esnek bir önlem setiyle çalıştığından erişimi daraltılmış durumda.
Programın ölçütleri de yayımlanmış durumda. Öncelik sırasında devletler ve ulusal siber otoriteler, kritik altyapı işletmecileri ile temel teknoloji platformları geçiyor. Savunma odaklı akademik laboratuvarlar da başvurabiliyor. Google, başvuran kurumlara arka plan kontrolü uyguluyor. Erişimin paylaşılması, yeniden dağıtılması veya satılması yasaklanmış. Kimlik avına dayanıklı çok faktörlü doğrulama ise zorunlu tutulmuş.
Google'ın yayımladığı iki iç bulgu, modelin savunma tarafındaki iddiasını özetliyor. Chrome Güvenlik ekibi, tarayıcıdaki güvenlik açığı vakalarında 2,6 kat daha fazla doğru otomatik yama üretildiğini bildiriyor. Karşılaştırma, kendisinden çok daha büyük en iyi ticari modellerle yapılmış. Google Cloud Vulnerability Research ekibi ise normalde aylar süren kritik bir temel açığı 2 saatten kısa sürede bulmuş. Program 650'den fazla ortakla yürütülüyor.
Cyber sürümüne dair rakamların karşılaştırma değeri sınırlı. Dahili test seti 1200'den fazla doğrulanmış geçmiş açık üzerinde ölçülmüş, ancak set kamuya açık değil. Standart 3.8 Flash ile Cyber sürümünü aynı eksende karşılaştırmak da mümkün değil. İkisi ayrı benchmark setlerinde ölçülmüş. Karşılaştırmanızı standart sürümler arasında tutmanız daha sağlıklı sonuç verir.
Bu makale en son 09 Eylül 2026 Çarşamba tarihinde güncellenmiştir. Bugün bu makaleyi 2 ziyaretçi okudu.