Birkaç hafta önce Qwen 3.8 ile açık ağırlıklı modellerin üst sınıfa ulaştığını yazmıştık. Kapalı modeller tarafında ise OpenAI cevabını verdi: GPT-6 Astra, 3 Eylül 2026'da sınırlı sayıda kuruma, ertesi gün ise geniş kullanıma açıldı.
OpenAI modeli GPT-5.6 Sol'un halefi ve şirketin yeni amiral gemisi olarak konumlandırıyor. Bu yazıda Astra'nın gerçekte neler sunduğuna, kıyaslama tablosunun nerede parladığına ve nerede dikkatli okunması gerektiğine bakıyoruz.
GPT-6 Astra'yı Öne Çıkaran Ne?
OpenAI'ın vurguladığı alanlar bilgisayar kullanımı, yazılım mühendisliği, bilim, profesyonel iş ve siber güvenlik. Pratikte bu şu anlama geliyor: Astra bir sohbet modelinden çok, çok adımlı işleri uçtan uca yürütmek için tasarlanmış bir model.
Temel teknik özellikler:
- Bağlam penceresi: 1.050.000 token, tek yanıtta en fazla 128.000 token çıktı.
- Bilgi kesim tarihi: 30 Nisan 2026.
- Uzun bağlam performansı: MRCR v2 8-needle testinde 512K ile 1M token aralığında %96,3 geri getirme.
- Erişim: ChatGPT Plus, Pro, Business ve Enterprise planları, OpenAI API, Microsoft Azure ve AWS Bedrock. Enterprise hesaplarda varsayılan olarak kapalı, çalışma alanı bazında açılıyor.
Bilgisayar kullanımında OpenAI, Astra'nın OSWorld 2.0'da görev başına GPT-5.6 Sol'a göre yaklaşık %47 daha az süre harcadığını belirtiyor. Ajan senaryolarında hız, doğruluk kadar önemli bir maliyet kalemi.
Kıyaslamalarda Ne Gösteriyor?
Aşağıdaki tablo OpenAI'ın yayımladığı sonuçlardan, rakip verisi bulunan satırları içeriyor:
| Kıyaslama | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5 |
|---|---|---|---|
| OSWorld 2.0 (bilgisayar kullanımı) | 72,6 | Açıklanmadı | 70,2 |
| Terminal-Bench 4.0 | 57,7 | 55,8 | 52,3 |
| DeepSWE v1.1 | 74,1 | 69,9 | Açıklanmadı |
| GPQA Diamond | 96,0 | 93,7 | 93,7 |
| FrontierMath Tier 4 | 97,6 | 87,8 | 73,2 |
| Humanity's Last Exam (araçlarla) | 57,2 | 65,0 | 63,6 |
Tablo iki şeyi birlikte söylüyor. Astra kodlama, terminal ve matematik ağırlıklı testlerde önde. Ama bu temiz bir süpürme değil: araç kullanımlı Humanity's Last Exam'de hem Fable 5.1'in hem de Opus 5'in gerisinde. FrontierCode 1.1 gibi bazı testlerde ise üç model neredeyse başa baş.
Rakamların Arkasındaki Uyarılar
Duyurularda öne çıkan bazı rakamlar, dipnotlarıyla birlikte okunduğunda farklı bir anlam kazanıyor.
ARC-AGI-3'teki %99,9
En çok paylaşılan rakam bu. Ancak sonuç, durum tutan özel bir test düzeneğiyle elde edilmiş. Standart, durumsuz API çağrılarıyla aynı test, seçilen akıl yürütme seviyesine göre %17 ile %63 arasında sonuç veriyor. Yani kendi uygulamanızda API üzerinden alacağınız performans bu manşetten çok farklı olabilir.
OSWorld sonuçları
OSWorld 2.0 skorları gecikme simülasyonuna bağlı. Gerçek bir kurumsal masaüstünde, gerçek ağ ve uygulama gecikmeleriyle aynı sonucun alınacağının garantisi yok.
Tüm tablo OpenAI kaynaklı
Yukarıdaki sayıların tamamı OpenAI'ın kendi ölçümü ve bazı satırlarda rakip verisi hiç yok. Bağımsız değerlendirmeler geldikçe tablo değişebilir.
Siber Güvenlik: İlk Kez "Kritik" Eşikte
Astra'yı önceki modellerden ayıran belki de en önemli nokta bu. OpenAI'ın kendi risk çerçevesine göre model, siber güvenlik yeteneklerinde "Critical" eşiğine ulaşıyor. Şirketin tanımıyla bu, doğru araçlar ve erişimle modelin iyi korunan sistemlerde daha önce bilinmeyen açıkları bulup istismar yolları geliştirebilmesi anlamına geliyor.
Bunun pratik sonuçları var:
- Güvenli kod incelemesi ve yama üretimi açık, ancak çalışan istismar kodu (proof of concept) üretimi başlangıçta reddediliyor.
- İstismar doğrulama, zararlı yazılım analizi ve tespit mühendisliği gibi gelişmiş yetenekler, OpenAI'ın Daybreak programı üzerinden kontrollü erişimle açılıyor.
- Ek güvenlik kontrolleri meşru savunma çalışmalarını da zaman zaman durdurabiliyor. ChatGPT ve Codex'te model işlem için onay isteyebilirken, API'de görev doğrudan durabiliyor.
Güvenlik ekipleri için bu bir ikilem: modelin savunma değeri yüksek, ama tam da bu yüzden erişimi kısıtlı.
Fiyatlandırma ve Kime Uygun?
Astra ucuz bir model değil:
| Kalem | Fiyat (1 milyon token başına) |
|---|---|
| Girdi | 10,00 dolar |
| Önbellekten okunan girdi | 1,00 dolar |
| Çıktı | 50,00 dolar |
Ayrıca yaklaşık 2,5 kat hızlı çalışan ve iki kat ücretlendirilen bir hızlı mod da sunuluyor. Karşılaştırma için: Qwen3.8-Max API üzerinden milyon token başına 2 dolar girdi ve 6 dolar çıktı ile sunuluyor.
Bu fiyat, Astra'nın nerede anlamlı olduğunu da belirliyor. Çok adımlı ajan görevleri, karmaşık kod tabanları üzerinde çalışma ve hatanın pahalı olduğu profesyonel işler için güçlü bir aday. Toplu metin üretimi, sınıflandırma ya da basit özetleme gibi rutin işler için ise maliyeti gerekçelendirmek zor; bu işler daha küçük modellerle çok daha ekonomik yapılabiliyor.
Bilinen Sınırlamalar
Akıl yürütmenin izlenebilirliği geriledi. Astra daha kısa ve daha kontrollü akıl yürütme zincirleri üretiyor. Bu verimlilik sağlıyor ama modelin nasıl düşündüğünü izlemeyi zorlaştırıyor. İngiltere Yapay Zeka Güvenlik Enstitüsü (UK AISI) değerlendirmesinde, saldırgan istemler altında izlemeden kaçınma davranışları tespit edildi.
Maliyet ve kapasite dengesi. Yüksek çıktı fiyatı, uzun yanıt üreten ajan döngülerinde faturayı hızla büyütebilir. Bütçe sınırı olmadan üretime alınmamalı.
Güvenlik kontrolleri iş akışını kesebilir. Özellikle güvenlik, altyapı ve sistem yönetimi alanında çalışan ekipler, meşru görevlerin beklenmedik şekilde durdurulmasını hesaba katmalı.
Sonuç
GPT-6 Astra, ajan görevleri ve kodlama tarafında kapalı modellerin sınırını ileri taşıyor. Ama kıyaslama tablosu tek taraflı bir üstünlük göstermiyor, manşet rakamların bir kısmı özel koşullara bağlı, fiyatı ise onu açıkça premium bir seçenek yapıyor.
Bizim tavsiyemiz her büyük model duyurusunda olduğu gibi: modeli kendi iş yükünüzde, kendi maliyet ve gecikme hedeflerinizle ölçün. Aynı görev için Astra, Claude ailesi ve Qwen 3.8 gibi açık ağırlıklı bir alternatif arasında yapılacak kısa bir karşılaştırma, çoğu zaman manşetlerden daha çok şey söyler. Model seçimi ve ajan mimarisi çalışmalarını Yapay Zeka Çözümleri hizmetimiz kapsamında yürütüyoruz. Otonom modellerin yazılım geliştirmeye etkisini ise Claude Fable 5 yazımızda ele almıştık.