Cluster

Modelle und Infrastruktur

Modellauswahl, Inferenzkosten, lokaler Betrieb, Kompression und Serving-Architektur.

Blogbeiträge
57
Thema
AI und Agents

Mit dem Grundlagenartikel starten

Postfach, ohne Lärm

Erhalte die nächste Feldnotiz zu AI und Agents

Eine kurze E-Mail, wenn wir veröffentlichen. Ohne Tracking-Pixel und ohne Postfachfüller.

Neu in dieser Sammlung

Wavect-Editorial-Grafik zur Trennung von Modellleistung und dauerhafter Produktdifferenzierung bei Laya vs Jev KI & Agenten

Laya vs Jev: Benchmarks und das Risiko für KI-Startups

Kann ein offener Spezialist zwei Jahre Vorsprung gefährden? Was Laya tatsächlich zeigt, was im Jev-Vergleich fehlt und wo belastbarer Kundennutzen entsteht.

Wavect-Editorialgrafik einer typisierten Entscheidungsverzweigung für das KI-Modell Jev KI & Agenten

Jev AI im Test: Entscheidungsmodelle für Agenten

Jev trifft typisierte Entscheidungen statt Prosa zu erzeugen. So kann es Modelle routen, Agentenschritte steuern und begrenzte Automatisierung ergänzen, ohne harte Regeln zu ersetzen.

Ein Smartphone und ein Laptop teilen ein großes Sprachmodell zwischen Browser-Tabs, während WebRTC Aktivierungen zwischen ihnen überträgt KI & Agenten

SwarmLLM Test 2026: Browser-P2P-Inferenz auf Smartphone und Laptop

Käuferorientierter SwarmLLM-Test: 27B-Inferenz im Browser, WebGPU und WebRTC, Benchmark-Grenzen, Peer-Trust, Security und ein klarer Pilotplan.

Eine Telefon-Wellenform läuft durch das Alma Voice-LLM in eine Production-Evaluierung KI & Agenten

Phonely Alma im Test: Ist das Voice-LLM produktionsreif?

Alma verspricht 182 ms TTFT, 206 ms P99 und 0,55 USD pro gemischter Million Tokens. Was belegt der Test, was fehlt und wie sieht ein Buyer-Pilot aus?

Gestapelte Utopia-Wissensstände zeigen erhaltene Historie KI & Agenten

Utopia: Temporalen Wissensgraph im Unternehmen prüfen

Utopia für Unternehmen prüfen: zwei Zeitachsen, Quellenbelege, Grenzen beim Self-Hosting und ein konkreter Pilotplan für belastbare historische Antworten.

NVIDIA PAIR routet lokale KI-Agent-Anfragen zwischen RTX, Mac und einem AMD-Strix-Halo-Node KI & Agenten

NVIDIA PAIR im Test: Lokales KI-Routing und die AMD-Lücke

PAIR routet unabhängige Agent-Anfragen zwischen lokalen Rechnern, ohne GPUs zu bündeln. So funktioniert es, hier fehlt Strix Halo und das muss ein AMD-Port beweisen.

Vollständiges Artikelverzeichnis

  1. Laya vs Jev: Benchmarks und das Risiko für KI-Startups
  2. Jev AI im Test: Entscheidungsmodelle für Agenten
  3. SwarmLLM Test 2026: Browser-P2P-Inferenz auf Smartphone und Laptop
  4. Phonely Alma im Test: Ist das Voice-LLM produktionsreif?
  5. Utopia: Temporalen Wissensgraph im Unternehmen prüfen
  6. NVIDIA PAIR im Test: Lokales KI-Routing und die AMD-Lücke
  7. Tencent Hy4 Preview im Test: Lohnt sich das 1M-Kontextmodell?
  8. PageLM im Check: Selbst hosten und kommerziell nutzen
  9. M6 Mac mini vs. M5 Mac Studio für lokale KI: Kaufberatung
  10. FreeToken AI im Test: Frontier-MoE auf Consumer-GPUs?
  11. Darkbloom AI Test: Private Inferenz auf freien Macs
  12. Ox Alpha als GLM-5.3-Flash enthüllt: Was sich ändert
  13. Pika Audio API Preise: Sind Soundeffekte wirklich 20x günstiger?
  14. Thunder Computes 13-Mio.-Dollar-Wette auf GPU-Virtualisierung: Einkaufsleitfaden
  15. AirLLM mit 4 GB VRAM: So funktioniert Layer-wise Inference
  16. Qwen3.8-27B: Computer-Use-Agenten selbst hosten, ohne Screenshots zu exportieren
  17. Der vLLM- und Triton-Stack von Netflix: 7 Produktionslektionen
  18. Transformers.js im Browser: Wann lokale KI in dein Produkt gehört
  19. LiteLLM selbst hosten: Production-Guide 2026
  20. KI-fähiges Unternehmenswiki: Architektur und Aufbau
  21. Versieht Claude Texte mit Wasserzeichen? API-Antwort 2026
  22. OpenKB Review: Knowledge Compiler vs. RAG
  23. Unsloth Desktop im Test: Private lokale KI-Workstation?
  24. NeMo Switchyard 0.2: Agenten-Routing ohne Training?
  25. Firecrawl AnyDoc im Test: 14 Formate zu Markdown
  26. Muse Glimmer 30B: Ist Metas lokales Agentenmodell produktionsreif?
  27. OmniRoute KI-Routing: Setup und Produktions-Checkliste
  28. Gemini Robotics 2: Ganzkörpersteuerung und die Pilotentscheidung
  29. pdf-inspector im Test: PDFs vor OCR lokal routen
  30. Lokaler multimodaler KI-Coding-Assistent: Sprache, OCR und Datenschutz
  31. DeepSeek V4 Flash 0731 auf einem KI-PC: Was funktioniert?
  32. Gemma 4 kostenlos mit Unsloth und Colab tunen
  33. Taalas HC1 im Check: Lohnt sich ein fest verdrahteter LLM-ASIC?
  34. Welches lokale LLM läuft auf deiner Hardware? llmfit Guide
  35. Miso TTS selbst hosten oder API: Kosten, Latenz und VRAM
  36. RAG-Vektoren auf 2 Bit komprimieren: Ist datenunabhängige Quantisierung produktionsreif?
  37. LMCache meldet 13,7x niedrigere mittlere TTFT mit gemeinsamem KV Cache
  38. Verlustfreie LLM-Kompression vs. 8-bit GGUF: Was ist produktionsreif?
  39. Cisco Antares im Test: 1B Local AI für Vulnerability Localization
  40. NVIDIA Nemotron 3.5 ASR: Ist Self-Hosted STT bereit für Voice Agents?
  41. Kimi K3 für EU-Unternehmen: API-Kosten, Datenschutz und Pilotplan
  42. Mesh LLM im Test: Ein großes LLM auf mehreren Rechnern ausführen?
  43. Bonsai 27B im Test: Läuft ein 27B-LLM wirklich auf dem Smartphone?
  44. Soofi S: Ist Deutschlands souveränes LLM bereit für Unternehmen?
  45. Colibri führt GLM-5.2 auf Consumer-Hardware aus. Der Haken.
  46. Wann lokale Modelle APIs schlagen: Break-even-Rechner für EU-Unternehmen
  47. LLM-Kostenrechner 2026: Rechne pro Aufgabe, nicht pro Token
  48. Pxpipe im Test: Senken Bilder Claude-Code-Kosten um 60%?
  49. Pro Token günstiger kann pro Aufgabe teurer sein
  50. Anthropic sagt Nein zum Open-Weights-Verbot. Der Kostenkampf bleibt real.
  51. LLM-Gateways im Vergleich 2026: LiteLLM vs OpenRouter vs Portkey vs RouteLLM
  52. LLMs in der EU selbst hosten: Wann sich Open Weights wirklich rechnen
  53. Beste Open-Weight-LLMs 2026: DeepSeek vs Qwen vs Kimi vs GLM vs Llama
  54. LLM-Token-Kosten 2026 senken
  55. Wann lohnt es sich, ein LLM-Eval zu bauen? Kosten, ROI und dem Judge vertrauen
  56. RAG, Fine-Tuning oder Long Context? Vergleich 2026
  57. LLM-API-Kosten 2026. Architektur-Shift