Call Center Doctors adlı çağrı merkezi danışmanlık şirketi, DeepSeek V4.1 Flash modelinin gerçekten Claude‘dan ’80 kat ucuz’ olup olmadığını anlamak için dört adet Nvidia H200 GPU kiraladı. Şirket, kodlama ajanlarında normalde kullandığı Claude Opus 5.5 yerine DeepSeek‘i devreye soktu ve sonuçları bir test raporunda paylaştı.
27 Eylül’de kiralanan dört GPU’luk sistem, gerçek kodlama iş yüküyle saniyede yaklaşık 213 token üretebildi. Bu performansın günlük maliyeti talep üzerine fiyatlandırmayla 440,88 dolara ulaşırken, aynı işin DeepSeek API üzerinden yapılması günlük 184 ila 223 dolar arasında kaldı. Şirket, bu rakamları gördükten sonra GPU kiralamak yerine tekrar Opus 5.5’e döndü; çünkü abonelik fiyatı, donanım kiralamaktan daha ucuza geldi.
Token kullanımı neden beklenenden farklı çıktı?
DeepSeek’in API fiyatlandırması, yoğun olmayan saatlerde 1 milyon giriş token başına 0,15 dolar, önbellekli giriş tokenlarında 0,003 dolar ve çıkış tokenlarında 0,60 dolar seviyesinde. Buna karşılık Anthropic‘in Claude Opus 5.5 modeli, 1 milyon token için 4 dolar giriş ve 20 dolar çıkış ücreti alıyor. Ancak testte dikkat çeken asıl detay, kodlama ajanlarının çalışma biçimiydi: ajanlara gönderilen metnin yüzde 96’sı, önceki konuşmaların tekrarından oluşan ‘bayat’ içerikti. Yani her yeni token için yaklaşık 1.000 eski token yeniden okunuyordu. Bu da GPU’nun çoğu zamanını yeni içerik üretmek yerine eski verileri tekrar taramakla geçirmesine yol açtı.
Bunlar da İlginizi Çekebilir
Sistemi kararlı şekilde çalıştırmak da kolay olmadı; beş deneme ve her seferinde 10-15 dakikalık yükleme süresi gerekti. Danışmanlığın hesaplamalarına göre, saatlik 18,37 dolarlık talep üzerine fiyatla standart bir ay için maliyet yaklaşık 13.200 dolara çıkıyor; bu da şirketin Eylül ayı Claude faturasının iki katından fazlası. Üstelik tek bir GPU kutusu günde yaklaşık 20 milyar token işleyebiliyor, oysa şirketin ajanları en yoğun günde 51 milyar token kullanmıştı.
Eylül ayı boyunca bir sunucuda 2,03 milyon model çağrısı, 388,5 milyar okunan token ve 393 milyon yazılan token kaydedildi. Şirketin Claude Code abonelik faturası yaklaşık 5.500 dolar olurken, aynı iş yükünün DeepSeek API üzerinden maliyeti 3.500 ila 7.000 dolar arasında, ortalama 4.200 dolar civarında hesaplandı. Oysa aynı tokenlar Claude’un liste fiyatından hesaplanırsa maliyet 140.000 dolara, yani abonelik ücretinin 25 katından fazlasına ulaşıyor. ’80 kat’ farkın kaynağı işte bu liste fiyatı karşılaştırması.
Testte DeepSeek’e hiç gerçek kod yazdırılamadı; inceleyenler, ajan kodunun sanal alandan kaçabileceği güvenlik açıkları buldu ve model yalnızca salt okunur inceleyici ajan olarak çalıştırıldı, 2.377 klasörü tarayıp 32 hata raporu oluşturdu. Saatlik 9,19 dolarlık spot fiyatla kiralanan GPU kutusu, testler biter bitmez sağlayıcı tarafından geri alındı.
Şirket, V4 nesli örneğinde Pro sürümünün Flash’tan daha iyi performans gösterdiğini hatırlatarak, henüz kesin çıkış tarihi olmayan DeepSeek V4.1-Pro‘nun bu dengeyi değiştirebileceğini belirtiyor. Yine de şu an için açık kaynaklı bir modeli çalıştırmak amacıyla GPU kiralamak, token harcamak için en mantıklı yöntem gibi görünmüyor. Rakip şirketlerin de benzer maliyet-performans testlerine yöneleceği, yapay zeka pazarında fiyatlandırma şeffaflığının önümüzdeki dönemde daha çok tartışılacağı söylenebilir.
Kaynak: Tom's Hardware




YORUMLAR
(0)