Clúster

Modelos e infraestructura

Selección de modelos, economía de inferencia, despliegue local, compresión y serving.

Artículos del blog
57
Tema
IA y agentes

Empieza por el artículo fundamental

Tu bandeja, sin ruido

Recibe la próxima nota de campo sobre IA y agentes

Un correo breve cuando publiquemos. Sin píxeles de seguimiento ni contenido de relleno.

Lo último en esta colección

Gráfico editorial de Wavect que distingue rendimiento del modelo y diferenciación del producto en Laya vs Jev IA y agentes

Laya vs Jev: benchmarks y riesgo para startups de IA

¿Puede un especialista abierto cuestionar dos años de ventaja? Lo que demuestra Laya, los límites de la comparación con Jev y el valor que una startup puede defender.

Ilustración editorial de Wavect sobre una bifurcación de decisiones tipadas para el modelo de IA Jev IA y agentes

Jev AI: análisis del modelo de decisión para agentes

Jev toma decisiones tipadas en vez de generar prosa. Descubre cómo puede enrutar modelos, controlar pasos de agentes y apoyar automatización acotada sin sustituir reglas duras.

Un móvil y un portátil reparten un gran modelo de lenguaje entre pestañas del navegador mientras WebRTC mueve activaciones entre ambos IA y agentes

SwarmLLM Review 2026: Inferencia LLM P2P entre móvil y portátil

Review para compradores de SwarmLLM: inferencia 27B en navegador, WebGPU/WebRTC, límites de benchmark, confianza entre peers, seguridad y plan de piloto.

Una onda telefónica atraviesa el LLM de voz Alma y llega a una evaluación de producción IA y agentes

Review de Phonely Alma: ¿Está listo el LLM de voz para producción?

Alma anuncia 182 ms de TTFT, 206 ms de P99 y 0,55 USD por millón de tokens mixtos. Analizamos la evidencia y diseñamos un piloto para compradores.

Capas de conocimiento de Utopia representan la historia conservada IA y agentes

Utopia: evaluar un grafo bitemporal empresarial

Evalúa Utopia para conocimiento empresarial: historial bitemporal, evidencia, límites del autoalojamiento y un piloto concreto antes de invertir.

NVIDIA PAIR enruta peticiones de agentes de IA local entre RTX, Mac y un nodo AMD Strix Halo IA y agentes

NVIDIA PAIR: Routing de IA Local y la Brecha de AMD

PAIR enruta peticiones independientes entre ordenadores locales sin agrupar GPUs. Analizamos cómo funciona, el límite de Strix Halo y qué debe probar un port para AMD.

Directorio completo de artículos

  1. Laya vs Jev: benchmarks y riesgo para startups de IA
  2. Jev AI: análisis del modelo de decisión para agentes
  3. SwarmLLM Review 2026: Inferencia LLM P2P entre móvil y portátil
  4. Review de Phonely Alma: ¿Está listo el LLM de voz para producción?
  5. Utopia: evaluar un grafo bitemporal empresarial
  6. NVIDIA PAIR: Routing de IA Local y la Brecha de AMD
  7. Análisis de Tencent Hy4 Preview: ¿Merece un piloto con contexto de 1M?
  8. PageLM: autoalojamiento y uso comercial
  9. Mac mini M6 vs Mac Studio M5 para IA local: guía de compra
  10. Análisis de FreeToken AI: ¿modelos MoE frontier en una GPU doméstica?
  11. Darkbloom AI: Inferencia Privada en Macs Inactivos
  12. Ox Alpha era GLM-5.3-Flash: qué ha cambiado
  13. Precios de Pika Audio API: ¿SFX cuesta de verdad 20 veces menos?
  14. La apuesta de $13M de Thunder Compute por virtualizar GPUs: guía de compra
  15. AirLLM con 4 GB de VRAM: cómo funciona la inferencia por capas
  16. Qwen3.8-27B: agentes de computer use autoalojados sin exportar capturas
  17. El stack vLLM y Triton de Netflix: 7 lecciones de producción
  18. Transformers.js en el navegador: cuándo llevar la IA local a tu producto
  19. Cómo autoalojar LiteLLM en producción: guía 2026
  20. Wiki empresarial preparada para IA: arquitectura e implementación
  21. ¿Claude añade marcas de agua al texto? Respuesta API 2026
  22. Review de OpenKB: compilador de conocimiento vs RAG
  23. Unsloth Desktop: ¿workstation privada de IA local?
  24. NeMo Switchyard 0.2: ¿routing de agentes sin entrenar?
  25. Firecrawl AnyDoc: 14 formatos a Markdown
  26. Muse Glimmer 30B: ¿está listo el agente local de Meta para producción?
  27. Routing de IA con OmniRoute: Setup y Checklist de Producción
  28. Gemini Robotics 2: control corporal completo y decisión de piloto
  29. pdf-inspector: parser PDF local antes del OCR
  30. Asistente de programación con IA local multimodal: voz, OCR y privacidad
  31. DeepSeek V4 Flash 0731 en un PC de IA: ¿qué funciona?
  32. Cómo afinar Gemma 4 gratis con Unsloth y Colab
  33. Taalas HC1 a examen: ¿compensa un ASIC para un solo LLM?
  34. ¿Qué LLM local puedes ejecutar? Guía de llmfit para tu hardware
  35. Miso TTS autoalojado vs API: coste, latencia y VRAM
  36. Comprime vectores RAG a 2 bits: ¿está lista para producción la cuantización sin datos?
  37. LMCache reportó un TTFT medio 13,7x menor con una caché KV compartida
  38. Compresión LLM sin Pérdida vs 8-bit GGUF: ¿Qué Está Listo?
  39. Review de Cisco Antares: IA local 1B para localizar vulnerabilidades
  40. NVIDIA Nemotron 3.5 ASR: ¿Está listo el STT self-hosted para voice agents?
  41. Kimi K3 para Empresas de la UE: Coste API, Datos y Plan de Piloto
  42. Mesh LLM: ¿Puede un LLM Ejecutarse en Varios Ordenadores?
  43. Review de Bonsai 27B: ¿Puede un LLM de 27B Ejecutarse en un Móvil?
  44. Soofi S: ¿Está listo para empresas el LLM soberano de Alemania?
  45. Colibri Ejecuta GLM-5.2 en Hardware de Consumo. Esta Es la Trampa.
  46. Cuándo los Modelos Locales Superan a las APIs: Calculadora Break-Even para Empresas de la UE
  47. Calculadora de Costes LLM 2026: Coste por Tarea, No por Token
  48. Review de Pxpipe: ¿reduce un 60% el coste de Claude Code?
  49. Más barato por token todavía puede costar más por tarea
  50. Anthropic rechaza prohibir pesos abiertos. La guerra de costes sigue.
  51. Gateways LLM Comparados 2026: LiteLLM vs OpenRouter vs Portkey vs RouteLLM
  52. Alojar LLMs en la UE: Cuándo Salen a Cuenta los Open Weights
  53. Mejores LLM de pesos abiertos 2026: DeepSeek vs Qwen vs Kimi vs GLM vs Llama
  54. Cómo Reducir los Costes de Tokens LLM en 2026
  55. ¿Cuándo vale la pena construir un eval de LLM? Coste, ROI y confiar en el juez
  56. ¿RAG, fine-tuning o contexto largo? Comparativa 2026
  57. Costes de APIs LLM 2026. Cambio de Arquitectura