Alibaba, bugüne kadarki en büyük modeli Qwen3.8-Max'i duyurdu: 2,4 trilyon parametre, 1 milyon token context ve açık ağırlık vaadi. Peki rakamların arkasında ne var, "açık" olması pratikte ne anlama geliyor?
3 Ağustos 2026'da Alibaba, bugüne kadar geliştirdiği en büyük ve en yetenekli yapay zekâ modelini duyurdu: Qwen3.8-Max. 2,4 trilyon parametre, 1 milyon token context penceresi ve "boş klasörden production'a, elle müdahale olmadan 10 günden uzun otonom geliştirme" iddiasıyla geldi.
Duyurunun zamanlaması da en az içeriği kadar dikkat çekici. Model, Çinli rakibi Moonshot AI'ın 2,8 trilyon parametreli Kimi K3'ünden yalnızca birkaç hafta sonra geldi ve açık ağırlıklarının önümüzdeki hafta yayınlanacağı açıklandı. Bu yazıda Qwen3.8-Max'in ne olduğunu, gerçek özelliklerini, fiyatını, benchmark sonuçlarını ve bu rakamlara ne kadar güvenilmesi gerektiğini tek tek ele alacağız.
Qwen3.8-Max Nedir?
Qwen3.8-Max, Alibaba'nın Qwen ailesindeki amiral büyük dil modeli. Mixture-of-Experts (MoE) mimarisiyle çalışıyor: toplam 2,4 trilyon parametresi var ama her istekte bunların tamamı değil, yaklaşık 95 milyarı devreye giriyor. Bu yaklaşım, dev bir modelin kalitesini makul bir işlem maliyeti ve yanıt süresiyle birleştirmenin standart yolu haline geldi.
Model 1 milyon token context penceresi sunuyor (pratikte yaklaşık 991 bin token giriş, 131 bin token çıkış) ve metnin yanı sıra görsel ile video girişini de anlıyor, çıktı olarak metin veriyor. Alibaba modeli uzun hukuki belgeler, büyük kod tabanları ve yüzlerce sayfalık dokümanları tek seferde analiz etme konusunda konumlandırıyor. Fonksiyon çağırma, yapılandırılmış çıktı ve web araması gibi ajan yetenekleri de destekleniyor.
Qwen3.8-Max'in Temel Özellikleri
Devasa ama seçici mimari
2,4 trilyon parametre, Qwen3.8-Max'i bugüne kadar duyurulmuş en büyük modellerden biri yapıyor. MoE sayesinde her token için yalnızca ilgili uzman alt kümesi çalışıyor. Sonuç: 2,4 trilyonluk bir modelin kalitesi, 95 milyarlık bir modelin işlem maliyetine yakın bir bütçeyle sunulabiliyor.
1 milyon token context
1M context penceresi, uzun soluklu ajan oturumları için alan açıyor. Alibaba'nın öne çıkardığı örnekler somut: yaklaşık 200 sayfalık dokümanları ve 100 saate varan video içeriğini tek oturumda işleyebilme.
Otonom kodlama iddiası
Duyurunun en iddialı başlığı bu. Alibaba, modelin 10 günden uzun süre kendi kendine evrilen bir geliştirme süreci yürüttüğünü, boş bir klasörden production kalitesinde bir projeye elle yönlendirilmeden ulaştığını ve tüm proje izinin GitHub'da yayınlandığını söylüyor. Ayrı bir örnekte bir yazılım mühendisliği projesinin 16 günde tamamlandığı belirtiliyor. Ajanların bu tür uzun görevleri nasıl planlayıp yürüttüğünü merak ediyorsanız
AI agent nedir yazımız iyi bir başlangıç.
Uzun-horizon iş simülasyonları
Model, tek bir soruya cevap vermenin ötesinde günler süren süreçlerle test edilmiş. Öne çıkan iki örnek: 365 günlük bir e-ticaret stratejisi simülasyonu ve 500 turu aşan bir çip tasarımı optimizasyonu. Bunlar klasik benchmark'lardan farklı, kapalı döngüde öğrenen ve kendi kararlarını düzelten senaryolar.
Görsel ve videoyu geri bildirim olarak kullanma
Modelin görsel yeteneği, görüntüyü tanımanın ötesine geçiyor. Vurgulanan nokta, görselin bir geri bildirim döngüsü olarak kullanılabilmesi: model ürettiği arayüzün ekran görüntüsüne bakıp kendi çıktısını düzeltebiliyor. Belge anlama testlerinde (OmniDocBench 1.5) 92,1 puan alıyor.
Açık ağırlık ve küçük kardeş model
Alibaba, Qwen3.8-Max'in ağırlıklarını önümüzdeki hafta yayınlayacağını açıkladı. Yanında Qwen3.8-27B de açık ağırlıklı olarak geliyor. Aşağıda göreceğiniz gibi, pratikte çoğu ekip için asıl anlamlı olan ikincisi.
Summit '25 sahnesinden
"Yarın tester'a, developer'a ihtiyaç olacak mı bilmiyoruz ama test etmeye ve development'a ihtiyaç olacak ve buna adapte olanlar daha önde olacak."
Melih Sakarya, Founder & CEO, Testinium
Konuşmanın tamamını izleyin →
Qwen3.8-Max vs Kimi K3 vs Claude Fable 5
Qwen3.8-Max'i doğru konumlandırmak için iki referansa bakmak gerekiyor: aynı kulvardaki açık Çin modeli Kimi K3 ve kapalı frontier tarafının tepesindeki Claude Fable 5. Tablo şöyle:
| Qwen3.8-Max | Kimi K3 | Claude Fable 5 | |
|---|---|---|---|
| Toplam parametre | 2,4 trilyon | 2,8 trilyon | Açıklanmadı |
| Aktif parametre | ~95 milyar | 16 uzman / 896 | Açıklanmadı |
| Context | 1M token | 1M token | 1M token |
| Giriş (1M token) | $2 | $3 | $10 |
| Çıkış (1M token) | $6 | $15 | $50 |
| Açık ağırlık | Evet (duyuruldu) | Evet | Hayır |
| Terminal-Bench 2.1 | 86,6 | n/a | 84,6 |
Tablodaki en çarpıcı satır fiyat. Qwen3.8-Max, Kimi K3'ten yaklaşık %35 (girişte) ve %60 (çıkışta), Claude Fable 5'ten ise beş ila sekiz kat ucuz. Üstelik önbelleğe alınan girişler sekiz kat daha ucuz işleniyor, yani aynı büyük context'i tekrar tekrar gönderen ajan iş yüklerinde fark daha da açılıyor. Kimi K3'ün detaylı mimarisi ve fiyat kırılımı için
Kimi K3 nedir yazımıza bakabilirsiniz.
Qwen3.8-Max Fiyatlandırması
API tarafında 1 milyon giriş token'ı $2, 1 milyon çıkış token'ı $6. Önbelleğe alınmış girişler bunun sekizde biri fiyatına işleniyor. Ayrıca Alibaba'nın Token Plan aboneliğinde standart fiyatın çok altında (bazı raporlara göre yaklaşık %10'u) erişim sunuluyor. Model, Alibaba'nın kodlama platformları Qoder ve QoderWork üzerinden de kullanılabiliyor.
Bu fiyat yapısı, geliştirici tarafında sessiz bir tartışmayı da alevlendirdi: tek bir sağlayıcıya bağlı yüksek aylık premium abonelikler mi, yoksa tek abonelikle birden fazla üst düzey Çin modeline (Qwen, DeepSeek, Kimi, GLM, MiniMax) aynı anda erişim veren token planları mı? Karşılaştırmayı yaparken dikkat edilecek nokta, çıktı verbositesi. Ucuz token, model gereğinden uzun cevap veriyorsa kâğıt üstündeki tasarrufu kısmen geri götürüyor. Kodlama ajanları ve token ekonomisi konusuna girmek isterseniz
Claude Code nedir yazımızda pratik örnekler var.
Benchmark Sonuçları ve Şerhler
Alibaba'nın paylaştığı ve bağımsız arenalardan gelen rakamlar şöyle:
| Test | Qwen3.8-Max | Not |
|---|---|---|
| Terminal-Bench 2.1 | 86,6 | Claude Opus 4.8 ve Fable 5: 84,6 |
| SWE-bench Pro | 67,7 | Gerçek yazılım hataları |
| FrontierSWE | 73,5 | Zor kodlama görevleri |
| OSWorld-Verified | 86,1 | Bilgisayar kullanma |
| OmniDocBench 1.5 | 92,1 | Belge anlama |
| PaperBench | 93,0 | Akademik içerik |
Bağımsız arenalarda tablo biraz daha ölçülü. Frontend Code Arena'da model 1.668 puanla dördüncü sırada: önünde Claude Opus 5 (1.705) ve Kimi K3 (1.676) var, Claude Opus 5'in bir diğer sürümüyle (1.669) ise neredeyse başa baş. Text Arena'da 1.496 puanla beşinci; meslek kırılımında tıp ve sağlıkta birinci sırada. Vision Arena'da 1.305 puanla dünya ikincisi, yalnızca bir Claude Fable 5 sürümünün 13 puan gerisinde.
Burada önemli bir şerh düşmek gerekiyor. Alibaba duyuru sırasında resmi bir benchmark tablosu, model kartı veya metodoloji yayınlamadı. "Fable 5'ten sonraki en güçlü model" iddiası şirketin kendi, yayınlanmamış dahili değerlendirmelerine dayanıyor. Bağımsız üçüncü taraf doğrulaması şu an çok sınırlı: gerçek bir yazılım projesinin analizine dayanan bağımsız bir testte önizleme sürümü 100 üzerinden 80 aldı, aynı testte Kimi K3 83 almıştı. Kısacası rakamlar heyecan verici ama henüz kesinleşmiş değil.
Avantajları
- Fiyat/performans: Frontier seviyesine yakın iddialarla sınıfının en düşük fiyatlarından biri, üstelik cache indirimi agresif.
- Uzun-horizon ajan görevleri: Günler süren otonom geliştirme ve simülasyon senaryolarına özel olarak konumlanmış.
- Gerçek multimodal: Görsel ve videoyu yalnızca girdi olarak değil, kendi çıktısını düzeltmek için geri bildirim olarak kullanabiliyor.
- 1M context: Büyük kod tabanları ve yüzlerce sayfalık dokümanlar için alan açıyor.
- Açık ağırlık vaadi: Hem Max hem de 27B sürümünün açılması, araştırma ve ince ayar tarafında kapıyı aralıyor.
Dezavantajları ve Uyarılar
- Doğrulama eksikliği: Resmi model kartı, benchmark tablosu ve metodoloji yayınlanmadı. Rakamların büyük kısmı üreticinin kendi beyanı.
- "Açık ama çalıştırılamaz" paradoksu: 2,4 trilyon parametrelik bir checkpoint, çok düğümlü veri merkezi işi. İndirilebilir olması, çalıştırılabilir olması demek değil.
- Aktif parametre belirsizliği uzun süre devam etti: Alibaba başlangıçta aktif parametre sayısını paylaşmadı, bu da sunucu maliyeti modellemesini zorlaştırdı.
- Otonom kodlama iddiası tek bir vitrin projesine dayanıyor: "10+ gün elle müdahale olmadan" iddiası etkileyici ama tekrarlanabilirliği bağımsız olarak test edilmiş değil.
- Veri ve uyum soruları: Çin merkezli bir sağlayıcının API'sini kullanmak, bazı sektörlerde veri yerleşimi ve uyum açısından ayrı bir değerlendirme gerektiriyor.
"Açık Ağırlık" Burada Ne Anlama Geliyor?
Duyurunun en çok konuşulan tarafı açık ağırlık vaadi oldu, ama bu ifadenin pratikteki karşılığını netleştirmek gerekiyor. 2,4 trilyon parametrelik bir modeli çalıştırmak, tek bir güçlü ekran kartı meselesi değil; çok GPU'lu sunucu kümeleri ve terabaytlar mertebesinde bellek gerektiriyor. Yani Qwen3.8-Max'in ağırlıkları yayınlandığında bunu indirip kendi sunucusunda çalıştırabilecek olanlar, büyük laboratuvarlar ve ciddi altyapıya sahip şirketler olacak.
Asıl pratik hikâye burada Qwen3.8-27B'de. 27 milyar parametrelik sürüm, sıradan GPU donanımıyla şirket içinde gerçekçi biçimde çalıştırılabilecek olan model. Veri hassasiyeti yüksek ekipler için "modeli kendi duvarlarımızın içinde çalıştırıyoruz" cümlesini mümkün kılan sürüm bu.
Yine de büyük modelin açılması sembolik olmanın ötesinde bir anlam taşıyor. Bağımsız araştırmacıların denetim yapabilmesi, akademik çalışma, ince ayar ve türev modeller için zemin oluşturuyor. Bir de rekabet boyutu var: Kimi K3'ten kısa süre sonra bu ölçekte ikinci bir açık modelin gelmesi, açık ağırlık tarafındaki tempoyu kapalı frontier tarafının temposuna yaklaştırıyor.
Sıkça Sorulan Sorular
Qwen3.8-Max ücretsiz mi?
API kullanımı ücretli: 1 milyon giriş token'ı $2, 1 milyon çıkış token'ı $6. Önbelleğe alınan girişler sekiz kat ucuz işleniyor. Alibaba'nın Token Plan aboneliği ve Qoder platformları üzerinden çok daha düşük maliyetli erişim seçenekleri sunuluyor. Ağırlıklar yayınlandığında, kendi altyapısında çalıştırabilenler için lisans maliyeti olmayacak, ancak donanım maliyeti devreye girecek.
Qwen3.8-Max'i kendi sunucumda çalıştırabilir miyim?
Pratikte çoğu ekip için hayır. 2,4 trilyon parametrelik model, çok düğümlü sunucu kümeleri ve terabayt mertebesinde bellek gerektiriyor. Şirket içi kurulum düşünüyorsanız gerçekçi yol, aynı anda açık ağırlıklı yayınlanan Qwen3.8-27B sürümü. Bu model geleneksel GPU donanımında çalıştırılabiliyor.
Qwen3.8-Max mi Kimi K3 mü daha iyi?
Cevap göreve bağlı. Fiyatta Qwen3.8-Max belirgin şekilde önde. İnsan tercihine dayanan Frontend Code Arena'da ise Kimi K3 bir sıra yukarıda. Gerçek bir yazılım projesinin analizine dayanan bağımsız bir testte de Kimi K3 (83) Qwen3.8-Max önizlemesinin (80) hafif önünde çıktı. Ancak farklar küçük ve iki modelin açık ağırlık takvimi de birbirine yakın. En sağlıklısı, kendi kullanım senaryonuzda ikisini yan yana denemek.
Sonuç
Qwen3.8-Max, açık ağırlıklı modellerin kapalı frontier modellerle arasındaki mesafeyi ne kadar kapattığını gösteren bir başka işaret. Fiyatı agresif, context penceresi geniş, uzun soluklu ajan görevlerine dönük iddiası ise sektörün gittiği yönü doğru okuduğunu gösteriyor. Vision Arena'da dünya ikinciliği ve tıp kategorisinde birincilik, tek başına ciddi rakamlar.
Buna karşılık aceleci bir sonuç çıkarmak için erken. Resmi model kartı, benchmark metodolojisi ve bağımsız testler henüz yayınlanmadı; en iddialı başlık olan "10 günlük otonom geliştirme" ise tek bir vitrin projesine dayanıyor. Ağırlıklar açıldığında tablo netleşecek. O zamana kadar en makul yaklaşım, kendi işinizden alınmış birkaç gerçek görevi Qwen3.8-Max, Kimi K3 ve kullandığınız mevcut model üzerinde paralel çalıştırıp maliyeti ve kaliteyi kendi verinizle ölçmek.
Yazar Hakkında
Topluluk Beta'da — Birlikte Geliştirelim
2400+ SaaS profesyonelinin buluştuğu platformun beta'sı açıldı. Deneyin, geri bildiriminizi paylaşın; platformu birlikte şekillendirelim.
Beta'yı Deneyin



