DeepSeek, ilk çok modlu modeli V4-Flash-Vision-Exp’in ağırlıklarını açık kaynak olarak yayınladı. 305 milyar parametre içeren bu model, MIT Lisansı altında Hugging Face platformunda erişime sunuldu. Yayın, 31 Ağustos’ta gerçekleştirildi ve bu, 21 Ağustos’ta API üzerinden tanıtımının yapılmasıyla başlayan bir sürecin tamamlandığını gösteriyor.
V4-Flash-Vision-Exp, geleneksel görsel-sözel modellerin aksine, görsel soru yanıtlama için tasarlanmadı. Bu model, AI ajanlarının görevleri gerçekleştirmesi için web ekran görüntülerini, yazılım arayüzlerini ve grafiklerini okuyarak görev akışlarını yönetmek üzere yapılandırılmadı. DeepSeek, modelin çok modlu ajan yeteneklerini, Anthropic’in amiral gemisi modeli Opus-4.8 ile karşılaştırarak “Opus-4.8’e yakın” olarak tanımladı.
Modelin Hugging Face sayfasında yayınlanan performans testleri bu değerlendirmeyi destekliyor. ApexBench Pass@1 testinde, model 36.5 puan alarak Opus-4.8’in 39.4 puanına yakın bir sonuç elde etti. Agents’ Last Exam’da ise 27.3 puan alarak, Opus-4.8’in 25.7 puanını geride bıraktı. Metin tabanlı ajan performansı ise görsel yeteneklerin eklenmesiyle Terminal Bench 2.1 testinde 82.7’den 83.9’a yükseldi. Ancak DeepSeek, modelin NL2Repo testinde 57.7 puan alarak Opus-4.8’in 69.7 puanının gerisinde kaldığını da kabul etti.
Yeni Stack tarafından yapılan erken bir karşılaştırmada, V4-Flash-Vision-Exp, Google’ın Gemini 3.7 Flash modeli ile dokuz görsel görevde karşılaştırıldı. Sonuç olarak, her iki modelin doğruluk açısından eşit olduğu bulundu; ancak DeepSeek’in modeli, toplamda yaklaşık üçte bir maliyetle ($0.0039 karşısında $0.0122) çalışırken, yanıt verme süresi iki katından fazla zaman aldı. OpenRouter’da, V4-Flash-Vision-Exp, milyon girdi tokeni için $0.22 ve milyon çıktı tokeni için $0.66 olarak listelenirken, Gemini 3.7 Flash’ın fiyatları sırasıyla $0.75 ve $3.75 olarak belirlendi.
Açık kaynak paketi, model ağırlıkları, tokenizer, istem kodlama referansları ve minimal PyTorch çıkarım uygulamasını içeriyor. Topluluk tarafından yapılan kuantize versiyonlar, yayınlandıktan birkaç saat içinde llama.cpp, LM Studio ve Ollama için ortaya çıktı. “Önce API, sonra açık ağırlıklar” yaklaşımı, DeepSeek’in kasıtlı bir stratejisini yansıtıyor: 21 Ağustos’ta API tanıtımının yanı sıra sürekli görev yürütme için Harness 0.1.1’i başlattı ve görsel model, daha geniş bir ajan araç setinin algısal katmanı olarak konumlandırıldı.







