Sınırları Zorlayan Bir Deney: 120 Milyar Parametreli Yapay Zeka Nasıl Çalıştırıldı?

- Yüksek performanslı yapay zeka modellerini çalıştırmak genellikle devasa donanım yatırımları gerektirirken, bir teknoloji meraklısı imkansızı başararak 120 milyar parametreli bir büyük dil modelini sıradan altı farklı cihazı birleştirerek çalıştırdı.
- Bu yaratıcı deney, yapay zeka teknolojisine erişimin geleceği hakkında önemli ipuçları sunuyor.
Büyük dil modelleri (LLM'ler), yapay zeka dünyasının son yıllardaki en etkileyici ve dönüştürücü yeniliklerinden biri haline geldi. Ancak bu modellerin gücünü tam anlamıyla kullanmak, genellikle yüz milyarlarca parametrelik yapıları nedeniyle akıl almaz miktarda işlem gücü ve bellek gerektiriyor. Bu da onları, özellikle bireysel kullanıcılar veya küçük geliştiriciler için, pahalı ve erişilemez kılıyor. Peki ya size, devasa bir yapay zeka modelinin, bir akıllı telefon, birkaç Mac bilgisayar ve Windows tabanlı bir masaüstü ile dizüstü bilgisayarın derme çatma bir araya getirilmesiyle çalıştırıldığını söylesek? Reddit kullanıcısı "Medicine_Blogscanner" tam da bunu başardı ve donanım sınırlarının yaratıcılıkla nasıl aşılabileceğini tüm dünyaya gösterdi.
Büyük Dil Modellerinin Donanım İhtiyaçları ve Erişim Zorlukları
gpt-oss-120b gibi 120 milyar parametreli bir büyük dil modelini verimli bir şekilde çalıştırmak, minimum 60 ila 80 gigabayt (GB) birleşik VRAM (ekran kartı belleği) ve sistem belleği gerektirir. Bu, modern bilgisayarların bile standart kapasitelerinin çok ötesinde bir rakamdır. Modeli sıkıştırmadan (unquantized) çalıştırmak isterseniz, bu ihtiyaç 240 GB gibi absürt bir seviyeye çıkar ki bu, piyasadaki çoğu tüketici donanımı için tam bir hayalperestlik anlamına gelir. Bu kadar yüksek bellek kapasiteleri genellikle yalnızca en üst düzey MacBook Pro modelleri veya yakın zamanda piyasaya sürülecek RTX Spark gibi çok yüksek fiyatlı, özel üretim makinelerde bulunabiliyor. Dolayısıyla, bu tür modellere erişim, genellikle büyük şirketlerin veya yüksek bütçeli araştırma kurumlarının tekelinde kalıyordu.
Sıradışı Bir Deney: Cihazlar Nasıl Birleşti?
"Medicine_Blogscanner" isimli kullanıcı, bu yüksek donanım gereksinimlerini altı farklı ve genellikle tek başına yetersiz kalacak cihazı bir araya getirerek karşıladı. İşte bu sıradışı "yapay zeka kümesi"nin bileşenleri:
- Samsung Galaxy S24+: Gücünü Android ekosisteminden alan amiral gemisi bir akıllı telefon.
- NVIDIA RTX 3060'lı Mini PC: 12GB VRAM'e sahip, oyun ve grafik işlemleri için tasarlanmış bir mini bilgisayar.
- Windows Dizüstü Bilgisayar: Sadece 12GB sistem belleğine sahip, mütevazı bir dizüstü bilgisayar.
- Intel İşlemcili MacBook Pro: Apple'ın önceki nesil güçlü dizüstü bilgisayarlarından biri.
- Mac mini: Apple'ın kompakt ve uygun fiyatlı masaüstü bilgisayarı.
- M3 MacBook Pro: Apple'ın son nesil güçlü M3 çipli dizüstü bilgisayarı.
Bu cihazların her biri, ayrı ayrı ele alındığında 120B parametreli bir LLM'i çalıştırmaya asla yetmeyecek kapasitelerdeydi. Ancak, deha, onları bir bütün olarak çalıştırmayı başarmakta yatıyordu. Bu deneyde kullanılan model, gpt-oss-120b'nin 4-bit kuantize edilmiş (sıkıştırılmış) versiyonuydu. Kuantizasyon sayesinde, modelin çalışması için gereken minimum bellek 60GB'a kadar düşürülmüştü, ancak bu hala tek bir tüketici cihazının sağlayamayacağı bir miktardı.
Teknolojik Mücadelenin Detayları: Pipeline Paralelliği ve Kuantizasyon
Bu devasa yapay zeka modelini, bu kadar farklı ve sınırlı kapasiteli cihazlar üzerinde çalıştırmanın arkasında iki temel teknik yatıyor: kuantizasyon ve pipeline paralelliği.
Kuantizasyon (Quantization): Veri Sıkıştırmanın Gücü
İlk olarak, gpt-oss-120b'nin ham halinin 240GB bellek ihtiyacı olduğu düşünüldüğünde, modelin 4-bit kuantize edilmiş versiyonunun kullanılması kritik bir adımdı. Kuantizasyon, yapay zeka modellerinin ağırlıklarını (parametrelere karşılık gelen sayılar) daha düşük hassasiyetli veri türlerine (örneğin 32-bit float yerine 4-bit integer) dönüştürerek bellek ayak izini önemli ölçüde azaltan bir tekniktir. Bu sayede, 240GB'lık bellek ihtiyacı, kabul edilebilir bir performans düşüşüyle 60GB seviyesine indirilebildi. Bu sıkıştırma olmadan, bu deney muhtemelen imkansız olurdu.
Pipeline Paralelliği (Pipeline Parallelism): Katmanlara Bölünmüş Zeka
Deneyin asıl dehası, cihazlar arası koordinasyonu sağlayan pipeline paralelliği tekniğinde gizliydi. Geleneksel olarak, bir yapay zeka modeli tek bir bilgisayarın belleğine yüklenir. Ancak bu yöntemde, modelin katmanlara ayrılmış yapay zeka beyni, ağdaki her bir cihaza dilimlenerek dağıtıldı. Yani, her bir cihaz, modelin belirli bir katmanını veya katman grubunu işlemekten sorumluydu. İş yükü de buna göre bölündü. Ana bilgisayar olarak adlandırılan "Tiny" isimli sistem, NVIDIA RTX 3060 ekran kartı ve yaklaşık 28.7GB toplam sistem belleği ile en büyük yükü üstlenirken, diğer cihazlar modelin farklı kısımlarını işlemek üzere "borudan" geçen veriyi sırayla tamamladı. Bu, her bir cihazın modelin tamamını yüklemesine gerek kalmadan, işbirliği içinde bir bütün olarak çalışmasını sağladı.
Performans ve Gerçek Dünya Uygulanabilirliği
Bu başarılı deneyin önemli bir ancak beklenen bir dezavantajı vardı: performans. Altı cihazdan oluşan bu küme, 120B parametreli gpt-oss-120b modelini saniyede yalnızca 1.1 token (kelime birimi) hızında çalıştırabildi. Bu hız, gerçek dünya üretkenliği veya anında yanıt gerektiren uygulamalar için inanılmaz derecede yavaştır. Bir metin oluşturma veya karmaşık bir sorguyu yanıtlama sürecinin dakikalar, hatta saatler sürebileceği anlamına gelir. Aktif bir internet bağlantısı olmadan çevrimdışı yapay zeka kullanımı için bir potansiyel sunsa da, pratiklik açısından büyük sınırlamalar getiriyor. Deneyin kendisi bir "imkansızı başarma" hikayesi olsa da, günlük kullanım için daha az yoğun modeller tercih etmek veya doğrudan yüksek donanımlı sistemlere yatırım yapmak şimdilik daha mantıklı görünüyor.
Mercek360 Değerlendirmesi: Yaratıcılığın ve Erişilebilirliğin Geleceği
"Medicine_Blogscanner"ın bu sansasyonel başarısı, Mercek360 olarak bizim için teknoloji dünyasında yenilikçiliğin ve problem çözme ruhunun ne kadar değerli olduğunu bir kez daha kanıtlıyor. Bu deney, doğrudan ticari bir uygulama sunmaktan ziyade, yapay zeka modellerine erişimin önündeki donanım engellerinin, yaratıcı yaklaşımlar ve yazılım optimizasyonlarıyla aşılabileceğini gösteren güçlü bir kanıt niteliğinde. Samsung Galaxy S24+ gibi bir akıllı telefondan M3 MacBook Pro'ya kadar geniş bir cihaz yelpazesinin bir araya getirilmesi, gelecek nesil yapay zeka geliştiricilerine ve meraklılarına ilham verebilir. Belki de bu tür pipeline paralelliği ve kuantizasyon teknikleri, gelecekte daha uygun maliyetli ve modüler AI donanım çözümlerinin geliştirilmesine öncülük edecektir. Şimdilik yavaş olsa da, bu tür deneyler, yapay zekanın demokratikleşmesi yolunda atılan önemli adımlardan biri olarak tarihe geçecektir. Teknoloji sadece en zenginlere değil, aynı zamanda en yaratıcı zihinlere de hizmet edebilir potansiyelini bir kez daha ortaya koydu.

Ozan Tankuş
Doğrulanmış EditörMercek360 kurucu editörü ve kıdemli teknoloji analisti. Kurumsal bilişim altyapıları, bulut teknolojileri, yapay zeka sistemleri ve tüketici elektroniği alanlarında uzmanlaşmış olup küresel teknoloji gündemini tarafsız ve derinlemesine incelemektedir.
