Logo von TSL Automation Solutions
Technologie3 Min. Lesezeit

NPU vs. GPU vs. CPU: Welcher Chip sollte Ihre Edge-KI-Workload ausführen?

TSL Automation Solutions 17. August 2026 Aktualisiert am 18.08.2026
Vergleich von NPU-, GPU- und CPU-Prozessoren für Edge-KI-Inferenz-Workloads im industriellen Computing
Teilen

Inhaltsverzeichnis

Warum ist die Wahl des Chips so wichtig?

Weil Edge-KI-Budgets inzwischen echtes Geld sind. Der Markt für Edge-KI-Hardware erreichte 26,14 Milliarden US-Dollar im Jahr 2025 und soll bis 2030 auf 58,90 Milliarden US-Dollar wachsen, eine CAGR von 17,6 % (MarketsandMarkets, 2025). Wählen Sie einen zu kleinen Chip, und die Linie wächst innerhalb eines Jahres darüber hinaus; zu groß, und Sie haben GPU-Geld bezahlt, um Flaschen zu zählen. Die gute Nachricht: Die drei Klassen, CPU, NPU und GPU, teilen den Workload-Raum sauberer auf, als das Marketing vermuten lässt.

Wann reicht eine einfache CPU aus?

Öfter, als die Anbieter zugeben. Bescheidene Modelle mit bescheidenen Auslastungszyklen, Barcode-Lesen mit gelegentlicher OCR, eine Klassifikation alle paar Sekunden, Anomalieprüfungen auf Sensordaten, laufen akzeptabel auf denselben Prozessoren der Atom- und Celeron-Klasse, die bereits in Industrie-Box-PCs wie dem NUC-EHL stecken. Keine zusätzliche Hardware, kein neues Thermodesign, kein zweiter Lieferant.

Der Hebel, der CPUs tragfähig macht, ist die Quantisierung. Die LiteRT-Dokumentation von Google misst, dass eine vollständige INT8-Quantisierung MobileNet-v1 von 16,9 MB auf 4,3 MB verkleinert, rund 4x kleiner, und gleichzeitig die Latenz von 124 ms auf 64 ms senkt, auf derselben Hardware (Google LiteRT-Dokumentation). Wenn Ihr quantisiertes Modell seine Zykluszeit auf der CPU einhält, die Sie bereits besitzen, sind Sie fertig, geben Sie die Ersparnis anderswo aus.

Was bringt Ihnen eine NPU tatsächlich?

Dauerhafte Inferenz ohne die Watt. Eine Neural Processing Unit ist eine Fixed-Function-Engine für die Multiplizier-Akkumulier-Rechnungen, aus denen neuronale Netze bestehen, und aktuelle Beispiele zeigen die Größenordnung: Intels Core Ultra 200V Plattform liefert bis zu 120 Plattform-TOPS, von denen die NPU 48 INT8-TOPS beisteuert (Intel Newsroom, 2024; The Register, 2024). Auf der ARM-Seite integriert der RK3588 von Rockchip eine NPU mit 6 TOPS, die Präzisionen von INT4 bis FP16 unterstützt (Rockchip, offiziell). Dedizierte Beschleunigermodule treiben die Effizienz noch weiter, der Hailo-8 von Hailo ist mit 26 TOPS bei typischen 2,5 W spezifiziert (Hailo, offiziell).

Die praktische Bedeutung: ein oder wenige kontinuierliche Kamerastreams, Fehlererkennung, Anwesenheitsüberwachung, Qualitätsgates, die die ganze Schicht über innerhalb eines lüfterlosen thermischen Rahmens laufen. In unserem Katalog ist das die Core Ultra Klasse, der EMS-ARH Box-PC, der APC-2146 Panel-PC und das EMX-PTLP Board tragen alle integrierte NPUs, und auf ARM-Seite bringt der ACP-3588 die 6 TOPS des RK3588 auf das Preisniveau eines lüfterlosen SBC.

Wann brauchen Sie eine GPU?

Wenn die Anzahl der Streams oder die Modellgröße Fixed-Function-Engines überfordert. NVIDIAs Embedded-Linie Jetson Orin veranschaulicht die Obergrenze: bis zu 275 TOPS bei 15 bis 60 W beim AGX Orin, 157 TOPS beim Orin NX, 67 TOPS beim Orin Nano (NVIDIA, offiziell). Diskrete PCIe-GPUs gehen noch weiter, bei Hunderten von Watt.

GPUs rechtfertigen dieses Leistungsbudget in drei Situationen: viele gleichzeitige Streams, die ein System speisen, eine AOI-Station, die ein Dutzend Kameras überwacht; große oder nicht quantisierte Modelle, Segmentierungsnetze, Workloads der LLM-Klasse; und schnelle Iteration, bei der die Software-Reife von CUDA die Entwicklung verkürzt. Das Hardware-Muster ist eine Workstation mit vollwertigen PCIe-Steckplätzen und Kühlung, in unserem Sortiment ist das die HPS-ERSUTA Klasse, ausgestattet mit der GPU, die Ihr Framework benötigt.

Wie sollten Sie tatsächlich entscheiden?

Arbeiten Sie rückwärts von der Linie, nicht vorwärts von den TOPS. Zählen Sie die Streams (eine Kamera oder zwölf), benennen Sie die Zykluszeit (eine Entscheidung alle 50 ms oder alle 5 s), dimensionieren Sie das Modell (ein quantisierter Klassifikator oder ein Segmentierungsnetz) und legen Sie das Gehäusebudget fest (geschlossener lüfterloser Schrank oder belüftetes Rack). Dann: leichte Last auf einem Stream, CPU. Kontinuierliche Bildverarbeitung auf einem bis wenigen Streams in einer lüfterlosen Box, NPU. Viele Streams oder schwere Modelle mit verfügbarer Kühlung, GPU.

Und betrachten Sie TOPS als Einstiegszahl, nicht als Urteil. Die Angaben mischen Präzisionen (INT8 vs. FP16 verdoppelt die Zahl ungefähr), setzen ideale Auslastung voraus und sagen nichts über das Speicherverhalten Ihres Modells aus. Der ehrliche Test ist Ihr Modell, quantisiert so, wie Sie es ausliefern werden, auf der Kandidaten-Hardware. Genau diese Benchmark-First-Dimensionierung ist unser Ansatz im Einkaufsleitfaden für Edge-KI-Server, und wenn die Frage Edge oder Cloud noch offen ist, beginnen Sie mit unserem Vergleich Edge vs. Cloud. Nennen Sie uns Ihre Kameraanzahl und Zykluszeit, und wir stellen Ihnen eine Hardware-Auswahl zusammen, gegen die Sie Benchmarks fahren können.

Häufig gestellte Fragen

Eine NPU ist eine Recheneinheit mit fester Funktion für neuronale Netzwerkberechnungen und äußerst effizient bei dauerhafter Inferenz: Die aktuelle NPU von Intel liefert 48 INT8 TOPS in einem Chip der Laptop-Klasse, und der Hailo-8 ist mit 26 TOPS bei etwa 2,5 W spezifiziert. GPUs sind flexibler und skalieren höher, der Jetson AGX Orin erreicht 275 TOPS, allerdings bei höherer Leistungsaufnahme und höheren Kosten.
Weniger, als das Marketing suggeriert. Ein quantisierter Klassifikator für einen Stream läuft auf einer CPU, eine NPU mit 6 TOPS wie die des RK3588 bewältigt kontinuierliche Bildverarbeitung auf einem Stream, und AOI über mehrere Streams treibt den Bedarf in Richtung mehrerer Dutzend bis hunderter TOPS. Vermessen Sie Ihr tatsächliches quantisiertes Modell, statt eine Kennzahl zu kaufen.
Ja, für leichte Workloads. Die LiteRT-Daten von Google zeigen, dass INT8-Quantisierung Modelle etwa 4-mal kleiner und 2-mal schneller macht (MobileNet-v1: 16,9 MB auf 4,3 MB, 124 ms auf 64 ms). Damit rücken Barcode-, OCR- und periodische Klassifizierungs-Workloads in Reichweite von Industrie-PCs der Atom- und Celeron-Klasse.
Die Umwandlung von Modellgewichten von Gleitkomma- in 8-Bit-Ganzzahlwerte. Sie verringert die Modellgröße um etwa 75 %, verdoppelt die Geschwindigkeit annähernd und kostet nur minimal Genauigkeit, und genau darauf sind NPUs optimiert. Die meisten Edge-Installationen sollten quantisieren, bevor sie größere Hardware kaufen.
Die Core-Ultra-Generation: der modulare Box-PC EMS-ARH, der Panel-PC APC-2146 und das Thin-Mini-ITX-Board EMX-PTLP enthalten alle die integrierte NPU von Intel, und der SBC ACP-3588 bringt die 6-TOPS-NPU des Rockchip RK3588 mit. Für Inferenz in GPU-Klasse nimmt die Workstation HPS-ERSUTA dedizierte PCIe-Karten auf.
Nur bedingt. Die Angaben vermischen INT8- und FP16-Genauigkeit (ein Unterschied von etwa dem Faktor 2), setzen eine perfekte Auslastung voraus und ignorieren die Speicherbandbreite, die reale Modelle häufig begrenzt. Nutzen Sie TOPS, um eine Hardwareklasse in die Vorauswahl zu nehmen, und validieren Sie dann mit Ihrem eigenen quantisierten Modell auf dem Zielsilizium.
Schlagwörter: NPU vs. GPU NPU vs. CPU Hardware für Edge-KI-Inferenz TOPS erklärt INT8-Quantisierung Edge-KI-Beschleuniger RK3588 NPU Intel Core Ultra NPU GPU-Inferenz am Edge Auswahl von KI-Hardware Hardware für Bildverarbeitung
War das hilfreich? Teilen Sie es
T

TSL Automation Solutions

Marketingleiterin, TSL Automation Solutions

Sanjana berichtet über Trends in der Industrieautomation, Produkteinführungen und Technologiethemen für TSL Automation Solutions, einen Distributor für HMI, Panel-PCs und Embedded-Computing-Systeme mit Sitz in Mumbai, der Hersteller in ganz Indien und weltweit beliefert.

Brauchen Sie Hilfe bei der Produktauswahl?

Unser Team in Mumbai empfiehlt Ihnen das passende HMI, den passenden Panel-PC oder das passende Embedded-System für Ihre Anwendung.

TSL Automation kontaktieren