Büyük Dil Modellerinin Eğitim Maliyeti ve Hesaplama Altyapısı

Büyük Dil Modellerinin Eğitim Maliyeti ve Hesaplama Altyapısı

GPT-4’ü eğitmek için harcanan para miktarı kamuoyuna duyurulmadı; ama OpenAI CEO’su Sam Altman 2023’te “yüz milyonlarca dolar” dedi ve bu rakamın hayli muhafazakar bir tahmin olduğu düşünülüyor. Peki bir modeli bu kadar pahalı yapan ne?

Hesaplama Gücü: GPU ve TPU Arenası

Büyük dil modellerinin eğitimi neredeyse tamamen GPU’lara bağlı. NVIDIA A100 ile H100 arasındaki fark sadece hız değil; H100, transformer mimarisine özgü tensor çarpımlarını yaklaşık 3 kat daha verimli işliyor. Meta’nın LLaMA 3.1 405B modelini 16.000 H100 GPU ile yaklaşık 30,84 milyon GPU-saati koşturarak eğittiği tahmin ediliyor. Bu rakamı 3 dolar/GPU-saat bulut fiyatıyla çarptığınızda yaklaşık 90 milyon dolara ulaşıyorsunuz — sadece işlem maliyeti için.

Google ise kendi TPU (Tensor Processing Unit) altyapısını kullandığından doğrudan karşılaştırma güç. Ama TPU v4 Pod, tek bir eğitim koşusu için 1024 çip barındırabiliyor ve bu çipler özellikle matris çarpımı için tasarlandığından Gemini Ultra gibi modellerde maliyet avantajı sağlıyor.

Veri Kümesi Hazırlığı: Görünmeyen Dev Kalem

Eğitim verisini temizlemek, filtrelemek ve etiketlemek genellikle hesaplama maliyetinin yarısına yakın bir bütçe istiyor. Common Crawl’dan ham HTML çekip onu kullanılabilir metne dönüştürmek tek başına ciddi bir iş. Üstüne RLHF (İnsan Geri Bildirimiyle Pekiştirmeli Öğrenme) eklediğinizde binlerce saat insan değerlendirmesi gerekiyor. Anthropic ve OpenAI bu iş için dış kaynak kullanan büyük veri etiketleme şirketleriyle çalıştığını açıkladı.

Enerji Tüketimi ve Karbon Ayak İzi

MIT’ten yapılan bir araştırmaya göre GPT-3’ün tek eğitim sürecinin karbon ayak izi yaklaşık 500 ton CO₂’ye eşdeğer. Bu, bir insanın arabayı 100 yıl sürmesine karşılık geliyor. Yeni nesil modellerde bu rakam kat kat artmış durumda. Bazı şirketler bunu dengelemek için yenilenebilir enerji sertifikaları satın alıyor, ancak bunun gerçek bir çözüm mü yoksa “greenwashing” mi olduğu tartışmalı.

Parametre Sayısı: Daha Büyük Her Zaman Daha İyi Mi?

GPT-3 175 milyar parametre ile piyasaya çıktığında rekor kırdı. Ama 2022’de DeepMind, Chinchilla modelini yayımladı ve şunu kanıtladı: 70 milyar parametreli bir model, eğitim verisi yeterince büyük olduğunda 280 milyar parametreli modeli geride bırakabiliyor. Bu “Chinchilla yasası” olarak biliniyor ve sektörün parametre yarışından veri kalitesi yarışına geçmesine yol açtı.

Dağıtık Eğitim: Binlerce Çipin Senkronizasyonu

Tek bir sunucu üzerinde 70 milyar parametre eğitemezsiniz; model belleğe sığmaz. Bu yüzden model paralelliği, veri paralelliği ve boru hattı paralelliği birlikte kullanılıyor. Meselä model paralelliğinde katmanlar farklı GPU’lara bölünüyor; bir katman çıktı üretirken bir sonraki katman o veriyi bekliyor. Bu bekleme süreleri (pipeline bubble) verimi düşürüyor ve mühendislerin öncelikli uğraş noktalarından biri oluyor.

Açık Kaynak Modeller Dengeyi Değiştiriyor mu?

Meta’nın LLaMA serisini açık kaynak yapması sektörde deprem etkisi yarattı. Küçük ekipler, milyarlarca dolarlık altyapıya sahip olmadan fine-tuning yaparak LLaMA’yı kendi veri kümeleriyle özelleştirebiliyor. Mistral 7B modeli bunun en iyi örneği: toplam 7 milyar parametre, minimal eğitim maliyeti ama GPT-3.5 ile karşılaştırılabilir performans. Ancak bu modeller sıfırdan eğitilmiyor; Meta’nın yaptığı büyük ön-eğitim üzerine oturuyorlar.

Inference Maliyeti: Eğitim Biter, Harcama Bitmez

Bir modeli eğitmek tek seferlik. Ama her sorgu işlemek de para istiyor. OpenAI’nin ChatGPT’nin zirve döneminde günde 10 milyon sorgu aldığı tahmin ediliyordu ve her sorgu için sunucu maliyeti birkaç sent olsa bile bu rakamlar hızla büyüyor. Bu yüzden şirketler quantization (modeli daha küçük hassasiyetle saklamak) ve speculative decoding gibi yöntemlerle inference maliyetini düşürmeye çalışıyor.

Rekabet bu denli yoğunken eğitim maliyetlerini aşağı çekme baskısı da artıyor. Hem daha verimli mimariler hem de özel donanımlar bu denklemin her iki tarafını aynı anda sıkıştırıyor; ancak en pahalı modellerin önümüzdeki yıllarda daha da pahalılaşacağı neredeyse kesin.

Benzer Yazılar