Clef und Clef-flash: Cloudflare startet zwei KI-Modelle für autonome Agenten
Veröffentlicht am: 02.10.2026 um 23:12 Uhr | Redaktion boerse-global.de
Cloudflare hat am 1. Oktober 2026 zwei auf der Qwen-Architektur basierende Entscheidungsmodelle namens Clef und Clef-flash vorgestellt. Die Systeme wurden entwickelt, um Wahrscheinlichkeiten für vordefinierte Antwortoptionen zu berechnen. Dadurch sollen autonome Software-Agenten fundiertere Entscheidungen treffen und Prozesse entweder selbstständig automatisieren oder bei Bedarf an menschliche Bearbeiter weiterreichen können.
Multimodale Architektur und erweiterte Kontextfenster
Die beiden Neuzugänge unterscheiden sich primär in Modellgröße und Spezialisierung. Das Modell Clef basiert auf Qwen3.8-27B und verfügt über 27 Milliarden Parameter, während die kleinere Variante Clef-flash auf Qwen3.5-9B aufbaut und 9 Milliarden Parameter umfasst. Beide Modelle sind als offene, multimodale Systeme ausgelegt und bieten eine API, die mit Jev kompatibel ist.
Im Vergleich zum bisherigen Entscheidungsmodell Jev, das auf reine Textverarbeitung und ein Kontextfenster von 32.000 Token beschränkt ist, verdoppelt Cloudflare die Kapazität: Clef bietet ein Kontextfenster von 64.000 Token, in technischen Spezifikationen werden auch bis zu 65.536 Token ausgewiesen.
Clef kann Text, JSON, Bilder und Videomaterial verarbeiten, wobei bis zu vier Bilder pro Anfrage unterstützt werden. Clef-flash ist wiederum auf die Klassifizierung von Bild- und Videoinhalten ausgelegt.
Leistungswerte und Latenzen im Benchmark-Vergleich
Nach Unternehmensangaben erzielten die Modelle in mehreren Benchmarks Geschwindigkeitsvorteile. Über 43 Testreihen hinweg belief sich die mediane Latenz von Clef-flash auf 38,8 Millisekunden, während Clef 209,3 Millisekunden verzeichnete.
Das Vergleichsmodell Jev lag bei 524,1 Millisekunden. Die am 1. Oktober 2026 veröffentlichten Werte des Hugging Face Decision Index 0.2.1 bestätigen diese Medianwerte und weisen für Clef einen p95-Wert von 238,6 Millisekunden sowie für Clef-flash von 122,4 Millisekunden aus.
In den internen Tests habe Clef mit Ausnahme des Modells Laya alle weiteren Entscheidungsmodelle bei der Latenz übertroffen. Bei einer Website-Klassifizierung benötigte Clef 2,2 Sekunden für eine Domain, während das Modell gpt-oss-120b 4,7 Sekunden in Anspruch nahm.
Inhaltlich lag Clef laut Berichten in sieben von zehn Tests des Decision Index vorne. Im Test BANKING77-Macro-F1 erreichte Clef einen Wert von 94,20 und Clef-flash 90,93, verglichen mit 79,74 bei Jev. Bei anspruchsvollen wissenschaftlichen Abfragen im Benchmark GPQA Diamond fiel Clef hingegen mit 48,0 gegenüber Jev mit 78,3 Punkten zurück.
Wer sich mit der Integration solch fortschrittlicher KI-Systeme befasst, muss auch die regulatorischen Rahmenbedingungen in Europa im Blick behalten. Dieser kostenlose Umsetzungsleitfaden bietet Unternehmen einen kompakten Überblick über alle Anforderungen, Pflichten und Fristen der EU-KI-Verordnung. EU AI Act in 5 Schritten verstehen: Fristen, Pflichten und Risikoklassen kompakt erklärt
In Workflow-Evaluationen übertraf Clef das System Jev bei der Rechnungsverarbeitung bezüglich exakter Aktionen mit 64,7 Prozent gegenüber 61,8 Prozent sowie im Kundenservice mit 76,3 Prozent gegenüber 76,0 Prozent.
Bei der Erkennung von Sicherheitsvorfällen lagen beide Modelle mit 62,9 Prozent zu 61,7 Prozent nahezu gleichauf, während Clef bei der Nachverfolgbarkeit von Agentenabläufen mit 68,5 Prozent gegenüber 71,6 Prozent den Kürzeren zog. Zu diesen Ergebnissen liegt bislang keine unabhängige Replikation oder externe Prüfung vor.
Lizenzierung, Preise und Hardwareanforderungen
Die Modelle werden unter der Apache-2.0-Lizenz auf der Plattform Hugging Face sowie über den Cloudflare-Dienst Workers AI bereitgestellt. Die Trainingsdaten hält das Unternehmen jedoch unter Verschluss. Für die Nutzung über Workers AI ruft Cloudflare für Clef einen Preis von 0,24 US-Dollar je eine Million Token auf, während Jev bei 0,042 US-Dollar je eine Million Token liegt.
Neben der technischen Leistungsfähigkeit neuer Modelle rücken auch die rechtlichen Risiken und Dokumentationspflichten beim Einsatz von KI zunehmend in den Fokus von Compliance-Abteilungen. Ein kostenloser Report klärt darüber auf, welche KI-Systeme als Hochrisiko eingestuft werden und was Unternehmen jetzt konkret tun müssen. Kostenlosen Umsetzungsleitfaden zum EU AI Act herunterladen
Für Organisationen, die die Modelle lokal betreiben wollen, sind hohe Rechenkapazitäten erforderlich: Bei einfacher Parallelität und vollem Kontextfenster von 64.000 Token benötigt Clef-flash 41 Gigabyte Grafikspeicher (VRAM), Clef setzt 85 Gigabyte GPU-VRAM voraus.
Cloudflare bietet für die Feinabstimmung der Modelle per bestärkendem Lernen (Reinforcement Learning) zunächst einen begleiteten Service an, plant jedoch auch ein Self-Service-Angebot. Details zu Verfügbarkeit, Preisen und technischen Spezifikationen dieses künftigen Produkts nannte Cloudflare bislang nicht.
