Zurück

Mixture of Experts (MoE)

Architektur und Praxisrelevanz für die Patentarbeit

Was ist MoE?

Mixture of Experts ist eine Modellarchitektur, bei der das neuronale Netz aus vielen spezialisierten Teil-Netzwerken (“Experten”) besteht. Ein Router-Netzwerk entscheidet für jedes einzelne Token, welche Experten aktiviert werden. Die übrigen bleiben inaktiv.

Kernidee: Großes Wissen (viele Parameter), schnelle Inferenz (wenige aktive Parameter).

Funktionsweise

Input-Token

  ↓

Router-Netzwerk (gating function)

  ↓

Wählt k von N Experten aus

  ↓

Nur die k Experten berechnen das Token

  ↓

Ergebnisse werden gewichtet zusammengeführt

  ↓

Output-Token

Beispiel gemma4:26b: 128 Experten + 1 gemeinsam genutzter Experte. Pro Token werden nur 8 von 128 aktiviert.

MoE vs. Dense: Vergleich

Eigenschaft MoE (gemma4:26b) Dense (gemma4:31b)
Gesamtparameter25.2B30.7B
Aktive Parameter pro Token3.8B30.7B (alle)
Experten128 + 1 sharedkeine (ein großes Netz)
Inferenz-GeschwindigkeitSchnellerLangsamer
VRAM-Bedarf~16 GB~20 GB
Qualität (Benchmarks)Leicht unter DenseEtwas besser
Wichtig: Obwohl nur 3.8B Parameter pro Token aktiv sind, müssen alle 25.2B Parameter im VRAM liegen. Der Router muss jederzeit auf jeden Experten zugreifen können.
Jedes Token läuft links durch alle 31B Parameter, rechts nur durch 8 von 128 Experten. Im Vollbild öffnen

Wann welche Architektur?

MoE sinnvoll

  • Multimodale Aufgaben (Bilder + Text)
  • Tiefenanalyse mit Thinking-Modus
  • Sehr langer Kontext (256K+)

Dense besser

  • Reine Text-Workflows (Ansprüche, Beschreibungen)
  • Parallele Multi-Agent-Pipelines
  • Deterministische Ausgaben

gemma4-Varianten im Überblick

Variante Typ Aktive Params Kontext Zielgerät
E2BSmall2.3B128KMobilgeräte
E4BSmall4.5B128KLaptops
26BMoE3.8B aktiv256KWorkstations
31BDense30.7B (alle)256KWorkstations

Thinking-Modus bei gemma4

gemma4 ist ein Thinking-Modell: es kann vor der Antwort intern “nachdenken”. In der Praxis:

  • Normale Requests: Thinking deaktiviert (think: false), verhindert leere Outputs bei strukturierten Prompts
  • Tiefenanalyse: Thinking aktiviert, erlaubt gründlichere Analyse, dauert aber 2-5 Minuten
Achtung: gemma4 verwendet einen anderen Disable-Mechanismus als qwen3.5. Der think: false API-Parameter ist erforderlich. Der /no_think-Prefix aus qwen3 funktioniert bei gemma4 nicht.
Quelle: Google DeepMind gemma4 Model Card, April 2026. Inhalte KI-generiert, ohne Gewähr.

Inhalte teilweise KI-generiert, kuratiert von Sebastian Goebel. Dies ist keine Rechtsberatung, sondern Trainingsmaterial für meine Workshops. Keine Gewährleistung für Richtigkeit oder Vollständigkeit. Keine Haftung. Software wird ohne Mängelgewähr bereitgestellt.