TEKNOLOJİ · GADGET · BİLİM —— BAĞIMSIZ TEKNOLOJİ YAYINI
teleservice TEKNOLOJİ MASASI

Cihazların, ağların ve yazılımın nasıl çalıştığını anlatan bağımsız teknoloji masası. Bir sonraki yıl da geçerli olacak açıklamalar.

Yapay Zeka

NPU Nedir: Telefonunuzdaki ve Dizüstü Bilgisayarınızdaki Yapay Zekâ İşlemcisi Açıklanıyor

Akıllı telefonunuzla seri çekim yaptığınızı hayal edin.

Yapay Zeka6 dakikalık okuma Güncelleme: Eylül 2026
Photograph of Intel Pentium II
Fotoğraf: Martijn Boer · Wikimedia Commons · Public domain

Akıllı telefonunuzla seri çekim yaptığınızı hayal edin. Göz açıp kapayıncaya kadar cihaz yüzleri tespit eder, portre modu bulanıklığını uygular ve en iyi kareleri önerir. Bir NPU'nun —yapay zekânın karmaşık matematiğinin üstesinden gelmek üzere tasarlanmış bir sinirsel işlem biriminin— gücünü deneyimliyorsunuz.

NPU'lar, standart işlemcilerin aksine, özelleşmiş yongalardır. Son çıkan telefonlarda ve dizüstü bilgisayarlarda bulunan bu birimler, çok az güç tüketirken belirli yapay zekâ görevlerini hızlandırır. Bu makale; böylesi düşük güçlü yapay zekâ hızlandırıcılarının neden önemli olduğunu, nasıl çalıştıklarını ve cihazınızda ne işe yaradıklarını açıklıyor.

NPU: Telefonunuzun ve Dizüstü Bilgisayarınızın İçindeki Yapay Zekâ Hızlandırıcı

Sinirsel işlem birimi (NPU), yapay zekâ ve makine öğrenimi uygulamaları için geliştirilmiş bir tür özelleşmiş donanım hızlandırıcıdır. Onların yapay zekâ hızlandırıcıları, derin öğrenme işlemcileri olarak adlandırıldığını da görürsünüz.

NPU'lar bağımsız çipler olabileceği gibi, bir merkezi işlem biriminin (CPU) ya da grafik işlem biriminin (GPU) bir parçası da olabilir. Her iki durumda da, heterojen bir bilgi işlem kurulumunda bu diğer işlemcilerle yan yana çalışacak şekilde tasarlanmışlardır. Akıllı telefonlarda bu, CPU ve GPU'nun yanı sıra yongada sistem (SoC) içindeki özel bir modül anlamına gelir. Dizüstü bilgisayarlarda ve PC'lerde ise NPU'lar genellikle yonga setine entegre edilmiş ek bir işlemcidir.

Bir NPU, IBM tarafından insan beyninin işleme fonksiyonunu taklit etmek üzere tasarlanmış bir işlemci olarak tanımlanır, bu nedenle NPU'lar sinir ağlarının ihtiyaç duyduğu görevler için optimize edilmiştir. Yapılandırmasına bağlı olarak bir NPU, bu işlemcilerden birden fazlasını destekleyebilir ve her görev için bunlardan birini etkinleştirebilir.

IBM ayrıca NPU'ların genellikle CPU ve GPU gibi birden fazla işlemciyi bir araya getiren heterojen mimariler içinde kullanıldığını belirtir. Bu da akıllı telefon işlemcinizin artık aslında her biri belirli bir göreve sahip birkaç işlemciden oluştuğu ve NPU'nun yapay zekâ çıkarım (inference) görevlerini üstlenen birim olduğu anlamına gelir.

Bir Penn uzmanına göre NPU'lar, yapay zekânın dayandığı matris aritmetiğini hızlandırır ve verilerle beslenerek bir model oluşturma süreci olan eğitimden ziyade, öncelikli olarak eğitilmiş bir modelin belirli bir amaç doğrultusunda kullanıldığı çıkarım gibi sinir ağı işlemlerini desteklemek üzere tasarlanmıştır.

HP'nin yapay zekâ donanım hızlandırıcısı kılavuzu, yapay zekâlı PC'lerde, yapay zekâlı dizüstü bilgisayarlarda ve mobil cihazlarda yer alan NPU'ların yapay zekâ iş yüklerinin yerel olarak işlenmesine olanak tanıyarak bulut sunucularına olan bağımlılığı azalttığını belirtir. Örneğin NPU'lar; ses tanıma, görüntü iyileştirme, arka plan bulanıklaştırma ve gerçek zamanlı transkripsiyon gibi görevleri üstlenerek gelişmiş kamera tasarımları veya sesli asistanlar gibi özelliklere olanak tanırken pil tüketimini de düşük tutar.

NPU'lar Matematiği Nasıl Yapıyor: Matris Aritmetiği ve Kuantize Edilmiş Modeller

NPU, özellikle tek bir amaç için tasarlanmış bir donanım parçasıdır: derin öğrenmenin yoğun şekilde kullandığı matris aritmetiği işlemlerini hızlandırmak, ki bu da çarpma-biriktirme (MAC) işlemlerine odaklandığı anlamına gelir.

Çıkarım aşamasında, bu tür işlemler iş yükünün büyük kısmını oluşturur. Her yinelemede, eğitilmiş sinir ağının ağırlıklarını temsil eden bir matris, girdi olan diğer matrisle çarpılır. Tekil sayıları çarpmak ve ardından sonuçları toplamak, tam olarak NPU'ların yapmak için üretildiği iştir.

Hepsinden iyisi, NPU'lar kuantize edilmiş sinir ağları için, yani en temel unsurlarına indirgenmiş ve INT8 veya INT4 olarak adlandırılan 4 veya 8 bitlik düşük duyarlıklı tamsayı biçiminde kaydedilmiş modeller için optimize edilmiştir.

Kuantizasyon modelin boyutunu küçültür, daha az bellek kullanır ve daha az hesaplama gerektirir; bu da hız ve enerji tasarruflu işlemler anlamına gelir.

Bunun için bir NPU, her biri tek bir çarpma-biriktirme işlemi gerçekleştiren minik birimlerle dolu özel bir MAC dizi bloğu kullanır. Her birimde aynı anda birden fazla işlem gerçekleşebilir ve aradaki veri aktarım sürelerini en aza indirmek için bellek hiyerarşisi optimize edilmiştir. Çoğu tüketici cihazında NPU, bellek verimliliğini en üst düzeye çıkarmak için LPDDR belleği CPU ve GPU ile paylaşır.

TOPS ve Performans: NPU Özellikleri Gerçekte Ne Anlama Geliyor

NPU'lar genellikle TOPS metriği ile tanımlanır: saniyede tera işlem veya tipik olarak INT8 hassasiyetinde ölçülen saniyede bir trilyon tamsayı işlemi.

Fikir vermesi açısından, bu değer yeni NPU'lar için 10 ila 100+ TOPS aralığındadır.

Ancak NPU'lar tüm işlemlerini gerçekte TOPS cinsinden ölçmez. Sinir ağları belirli bir hesaplama türüne —matris çarpımına— dayanır ve çoğu NPU bunun için tasarlanmıştır. Bu işte bu kadar iyi olmalarının nedeni de budur.

TOPS aynı zamanda pazarlama dostu bir metriktir. Üretici karşılaştırmalarını basitleştirir, ancak gerçek dünya senaryolarında NPU'nun ham gücünü temsil etmeyebilir.

Model seyrekliği, bellek bant genişliği ve yazılım desteği gibi diğer faktörlerin tümü performansı etkiler.

Kim Ne Yapıyor: Gerçek İş Yüklerinde CPU, GPU ve NPU Karşılaştırması

NPU'lar genellikle diğer başlıca yapay zekâ işlemcileri olan CPU'lar ve GPU'lar ile karşılaştırılır, ancak hepsinin hizmet ettiği amaç farklıdır.

PC'nin çeşitli işlemcilerinin yöneticisi konumundaki CPU, görevleri koordine eder, genel hesaplamaları ve daha küçük modelleri yürütür. Yapay zekâ işleri için bir NPU'dan daha yavaştır ve daha fazla güç harcar, ancak bir NPU'nun yapamadıkları da dahil olmak üzere çok çeşitli görevleri yönetebilir.

Bu arada GPU'lar, ağır iş yüklerinin üstesinden gelmek üzere tasarlanmış paralel işlemcilerdir ve yapay zekâ eğitimi için baskın işlemci türüdür. Eğitim; gerçek dünyada tahminler yapabilecek kadar isabetli bir model oluşturmak amacıyla, etiketlenmiş veriler kullanılarak bir sinir ağının parametrelerinin ayarlanmasını içerir.

Çıkarım ise aksine, eğitilmiş bir modelin gerçek zamanlı verilere uygulanmasını içerir. Görüntü sınıflandırma, nesne tanıma veya gerçek zamanlı transkripsiyon gibi Derin öğrenme görevlerini üstlenen NPU'ların parladığı yer tam da burasıdır.

Tüketici cihazlarında CPU daha düşük karmaşıklıktaki görevleri yerine getirmeye devam edebilirken, GPU yoğun yapay zekâ ve multimedya işlerini yürütür. Çıkarım sırasında NPU, matris aritmetiğini hızla işlemek için arka planda çalışır.

Fakat bu bir iş bölümüdür.

Bir örnek: Gerçek zamanlı nesne tanıma için kullanılan popüler bir derin öğrenme modeli ailesi olan eğitilmiş bir YOLO modelini uygularken. Anlaşıldı.

CPU ve GPU'nun her birine farklı sorumluluklar verilmiştir. CPU, TensorFlow gibi çerçeve kodlarını yönetmek ve modeli yüklemek için kullanılırken; GPU, modeli girdi görüntüsü veya videosu üzerinde çalıştırmanın daha yoğun işinden sorumludur. Bu durumda NPU, birçok yapay zekâ modelinin merkezinde yer alan görüntüleme matematiğine yardımcı olmak için kullanılmıştır.

Cihaz İçi NPU'lar Kullanıcılar İçin Neden Önemli

NPU'lar birçok modern telefonda ve dizüstü bilgisayarda yapay zekâ özelliklerinden sorumludur ve kullanıcılar için gerçek, pratik anlamda önem taşırlar.

Çıkarım işinin büyük kısmı yerel olarak, doğrudan cihazın içinde halledilir. Bu da NPU destekli yapay zekâ özelliklerini daha hızlı, daha duyarlı ve çevrimdışı kullanılabilir hale getirir.

Pil ömrü açısından NPU'lar büyük bir kazanımdır. Günümüzün akıllı telefonları ve dizüstü bilgisayarları yaklaşık 5 W'lık toplam SoC güç bütçelerinin altında çalışabilmektedir ve NPU'lar mevcut en enerji tasarruflu işlemcilerden bazılarıdır. Bu durum onları cihaz içi görevler için buluta bağlı CPU'ları veya GPU'ları kullanmaktan daha uygun hale getirir.

Belirli görevler için NPU'lar, CPU'lardan veya GPU'lardan katbekat daha hızlı olabilir. Bir NPU, aynı görev için görüntü iş yüklerini bir CPU'dan çok daha hızlı işleyebilir. [TO VERIFY: saniye başına belirli nesne karşılaştırması]

Aslında, ham sayı işleme gücünün sinir ağlarındaki karşılığını sağlarlar. Ve ilham aldıkları grafik çekirdekleri gibi gelişmeye devam ediyorlar: Bir kere, tek bir Google TPU (bir NPU değil) çok yüksek işlem oranlarının üstesinden gelebiliyor. [TO VERIFY: kesin TPU rakamı]

Telefonlarda ve dizüstü bilgisayarlarda karşılaşacağınız NPU'lar, bu tür bir gücü tüketici alanına taşır.

Kaynaklar

  1. Wikipedia, "Neural processing unit"
  2. IBM, "What is a Neural Processing Unit (NPU)?"
  3. Penn Today, "What is an NPU? A Penn expert explains"
  4. Android Police, "What is an NPU and how does it help AI magic happen?"
  5. HP Tech Takes, "Why Everyone's Talking About NPUs: What They Do and Why They Matter"
  6. Ecrionix, "CPU vs GPU vs TPU vs NPU — Architecture & Differences"
  7. Fluence Network blog, "CPU, GPU, TPU & NPU: What to Use for AI Workloads (2026 Guide)"
  8. KTH Royal Institute of Technology, "An Efficiency Comparision of NPU, CPU, and GPU When …", master’s thesis, full text PDF at

İlgili yazılar