Connect with us

Publicado

on

En un movimiento que sorprendió a la industria, NVIDIA presentó oficialmente en CES 2026 su nueva plataforma de computación para inteligencia artificial: la arquitectura Rubin (acompañada del CPU Vera), nombrada en honor a la astrónoma Vera Rubin. El CEO Jensen Huang anunció que ya está en producción completa y los primeros sistemas llegarán a partir de la segunda mitad de 2026.

Esta nueva generación representa el siguiente gran salto después de la exitosa arquitectura Blackwell, y llega en el momento perfecto para satisfacer la demanda explosiva de cómputo en modelos de IA cada vez más grandes y complejos.

Rendimiento brutal: 5x en inferencia y 3.5x en entrenamiento vs Blackwell

Según las cifras oficiales de NVIDIA, el GPU Rubin ofrece:

  • Hasta 50 petaFLOPS en inferencia NVFP4 (formato de precisión muy utilizado en IA moderna) → 5 veces más que el rendimiento de Blackwell
  • 35 petaFLOPS en entrenamiento NVFP4 → 3.5 veces más que Blackwell

Además, la plataforma completa promete:

  • Hasta 10 veces menor costo por token generado en inferencia
  • 4 veces menos GPUs necesarias para entrenar modelos Mixture-of-Experts (MoE) de gran escala

Estas mejoras se logran gracias a un diseño extremo de co-ingeniería entre seis chips diferentes que trabajan como un sistema unificado:

  • GPU Rubin (centro del cómputo)
  • CPU Vera (optimizado para razonamiento agentico)
  • Mejoras en NVLink 6 (interconexión GPU-GPU ultrarrápida)
  • BlueField-4 DPU
  • ConnectX-9 SuperNIC
  • Spectrum-6 Ethernet Switch

Otro avance clave es el nuevo subsistema de memoria y almacenamiento para manejar contextos extremadamente largos y el KV cache de modelos agenticos, que cada vez exigen mucho más capacidad y velocidad.

Eficiencia energética y el futuro de las AI factories

Uno de los mensajes más potentes de Jensen Huang fue: «Vera Rubin está diseñada para enfrentar el desafío fundamental: la cantidad de cómputo necesaria para IA se dispara exponencialmente».

La nueva arquitectura entrega hasta 8 veces más cómputo de inferencia por watt que generaciones anteriores, lo cual es crítico cuando hablamos de data centers que consumen cientos de megawatts.

NVIDIA también presentó el sistema Vera Rubin NVL72, un supercomputador en rack que unifica 72 GPUs Rubin, con ancho de banda de memoria por GPU cercano a 3.6 TB/s (casi el triple que Blackwell) y conectividad total de 260 TB/s en el rack.

¿Quiénes ya están en la fila?

Los principales hyperscalers y partners ya confirmaron que adoptarán Rubin en 2026:

  • AWS
  • Google Cloud
  • Microsoft Azure
  • Oracle Cloud Infrastructure (OCI)
  • CoreWeave
  • Anthropic
  • OpenAI
  • Y muchos más

También se esperan supercomputadoras como el futuro sistema Doudna del Lawrence Berkeley National Lab y el Blue Lion de HPE.

Conclusión: NVIDIA acelera aún más el ritmo

Con Rubin, NVIDIA demuestra una vez más su capacidad de mantener un ciclo de innovación anual que deja obsoletas generaciones anteriores en cuestión de meses. Si Blackwell ya había transformado la industria y convertido a NVIDIA en la empresa más valiosa del mundo, Rubin promete llevar la era de las AI factories y los modelos agenticos a una escala completamente nueva.

Los sistemas basados en Rubin comenzarán a llegar masivamente en la segunda mitad de 2026. Hasta entonces… prepárate, porque la carrera por el siguiente nivel de inteligencia artificial acaba de subir varios niveles de potencia.

Continue Reading
Advertisement
Click to comment

Leave a Reply

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

AI

Andrew Ng lanza OpenWorker, un agente de IA de código abierto

Publicado

on

Andrew Ng presentó OpenWorker, un agente de inteligencia artificial de código abierto que no se limita a chatear con el usuario, sino que entrega trabajo terminado: documentos redactados, mensajes de Slack enviados o eventos de calendario actualizados. El anuncio lo hizo el propio Ng junto a su socio Rohit Prasad, y la herramienta ya está disponible para descargar en Mac, con versión para Windows en camino.

El producto llega en un momento en que la carrera por los agentes de IA se acelera en todo el mundo, y Argentina no queda al margen de esa tendencia. OpenWorker funciona como una aplicación de escritorio construida con Tauri 2 y una interfaz en React, que se comunica con un servidor local en Python montado sobre FastAPI. A diferencia de otros asistentes que dependen de un servicio de inferencia propio, esta herramienta no tiene modelo propietario: el usuario debe traer su propia clave de API y elegir entre proveedores como OpenAI, Google o Anthropic, o bien optar por modelos de peso abierto como GLM, DeepSeek o Kimi, e incluso correr todo de forma local con Ollama para que los datos nunca salgan de la máquina.

El anuncio generó movimiento inmediato en el ecosistema de desarrolladores y en las redes de discusión tecnológica, donde OpenWorker fue comparado con otros agentes de escritorio que compiten por resolver tareas de oficina de punta a punta. El motor de la herramienta se apoya en aisuite, la biblioteca de enrutamiento de modelos que el propio Ng viene desarrollando, lo que le permite a las empresas alternar entre proveedores sin reescribir el código de sus flujos de trabajo. El repositorio publicado en GitHub suma más de 30 mil líneas de código en Python y una capa de permisos que clasifica cada acción del agente en cuatro niveles de riesgo, desde una simple lectura de archivos hasta una acción externa que requiere aprobación explícita del usuario antes de ejecutarse.

De cara a los próximos meses, el lanzamiento profundiza una discusión que ya venía instalada en la industria: si conviene depender de agentes cerrados y gestionados por una nube, o si el camino es hacia herramientas abiertas que corren en la computadora del usuario y solo se conectan a un proveedor de modelos cuando hace falta. No faltaron las voces críticas, que señalaron que aun con el código abierto, la dependencia de las claves de API de gigantes como OpenAI o Anthropic mantiene atada a la herramienta a esos mismos proveedores. Para los equipos de desarrollo y las empresas que evalúan sumar agentes a sus procesos, OpenWorker aparece como una alternativa concreta, gratuita y auditable, aunque con una barrera de entrada más alta que la de un asistente listo para usar: hay que instalar la aplicación, configurar las claves y, por ahora, contar con una computadora Mac.

Fuentes:

MarkTechPost: https://www.marktechpost.com/2026/07/23/andrew-ng-just-released-openworker-an-open-source-local-first-desktop-ai-coworker-that-returns-finished-deliverables-instead-of-chat/

Blockchain.News: https://blockchain.news/ainews/openworker-launches-open-source-agent-that-ships-work

Publicación de Andrew Ng en X: https://x.com/AndrewYNg/status/2080333504446108104

MoClaw Blog: https://moclaw.ai/blog/what-is-openworker

APIMart: https://apimart.ai/blog/openworker-andrew-ng-open-source-agents-deliver

Continue Reading

AI

Google lanza Gemini 3.6 Flash y acelera la carrera por modelos más rápidos y económicosddd

Publicado

on

Google presentó Gemini 3.6 Flash, la actualización más reciente de su línea de modelos livianos, orientada a aplicaciones que priorizan velocidad de respuesta y menor costo por consulta sobre el máximo poder de razonamiento. El lanzamiento se suma a una seguidilla de anuncios de modelos de frontera durante julio, en un momento en que la industria de la IA se mueve cada vez más hacia familias de modelos especializados por tarea y presupuesto, en lugar de apostar a un único modelo insignia.

Gemini 3.6 Flash se ubica dentro de la estrategia de Google de ofrecer variantes de distinto tamaño y costo computacional dentro de una misma familia, de forma similar a como OpenAI dividió su línea GPT-5.6 en versiones orientadas a razonamiento de alto nivel y versiones más económicas para tareas de uso masivo. Para desarrolladores empresariales, contar con una versión «Flash» actualizada significa poder desplegar asistentes conversacionales, herramientas de clasificación de datos o agentes de bajo costo sin necesidad de recurrir a los modelos más caros de la familia Gemini para cada tarea.

El lanzamiento se produce en un contexto de fuerte presión de precios en toda la industria: en julio se sucedieron los debuts de Grok 4.5 de xAI, la familia GPT-5.6 de OpenAI y modelos abiertos como Kimi K3 y Muse Spark 1.1, todos compitiendo por ofrecer más capacidad a menor costo por token. Analistas del sector describen este movimiento como el inicio de una verdadera guerra de precios en inferencia, en la que el costo de ejecutar inteligencia de frontera cae a un ritmo comparable al de una ley de Moore acelerada.

Para el usuario final, la multiplicación de modelos rápidos y económicos como Gemini 3.6 Flash se traduce en asistentes de IA integrados en más productos cotidianos —desde buscadores hasta aplicaciones móviles— sin los costos de latencia y factura que implicaban los modelos de mayor tamaño. La contracara es una industria cada vez más fragmentada, en la que elegir el modelo correcto para cada tarea específica se vuelve una decisión técnica y económica central para empresas y desarrolladores, y en la que la velocidad de iteración deja cada vez menos margen para el análisis pausado de riesgos de seguridad de cada nuevo lanzamiento.

Fuentes:
AI Release Tracker: https://aireleasetracker.com/latest
AIapps (July 2026 AI Mega-Update): https://www.aiapps.com/blog/july-ai-mega-update-major-breakthroughs-launches/

Continue Reading

AI

Kimi K3, de Moonshot AI, se lanza como el modelo abierto más grande del mundo

Publicado

on

La startup china Moonshot AI presentó Kimi K3, un modelo de mezcla de expertos (MoE) disperso con 2,8 billones de parámetros que, al momento de su lanzamiento, se convirtió en el modelo de inteligencia artificial abierto más grande jamás publicado. El sistema procesa de forma nativa texto, imágenes y video, sostiene una ventana de contexto de un millón de tokens y ya está disponible a través de la API y las aplicaciones de Kimi, con los pesos completamente abiertos previstos para el 27 de julio.

Desde el punto de vista técnico, Kimi K3 introduce dos novedades arquitectónicas: Kimi Delta Attention (KDA) y Attention Residuals, mecanismos diseñados específicamente para sostener la eficiencia en contextos extremadamente largos. El modelo coordina un total de 896 expertos bajo un framework llamado LatentMoE, de los cuales solo unos 16 se activan simultáneamente en cada inferencia, una estrategia que reduce drásticamente el costo computacional por consulta sin sacrificar capacidad total. Gracias a la cuantización de pesos en formato MXFP4, el almacenamiento del modelo se reduce a aproximadamente 1,4 terabytes, un tamaño que ya resulta manejable para que laboratorios y empresas lo alojen en infraestructura propia multi-nodo.

El posicionamiento de precios profundiza la disputa comercial entre los laboratorios de IA: Kimi K3 se ofrece a unos USD 3 por millón de tokens de entrada y USD 15 por millón de tokens de salida, sensiblemente más barato que los modelos de frontera equivalentes desarrollados en Estados Unidos. En materia de rendimiento, el modelo se ubicó primero en seis de siete dominios del Frontend Code Arena y obtuvo un puntaje de 88,3 en Terminal-Bench 2.1, benchmarks que evalúan la capacidad de generar y depurar código de forma autónoma.

El lanzamiento de Kimi K3 se da en medio de una ola de modelos abiertos que buscan ofrecer una alternativa real de autohospedaje frente a los sistemas cerrados de OpenAI, Google o Anthropic. Para empresas y desarrolladores, la disponibilidad de un modelo de este tamaño con licencia abierta reduce la dependencia de proveedores externos y plantea preguntas de fondo sobre soberanía de datos, seguridad y el futuro reparto de poder de cómputo entre laboratorios estadounidenses y chinos.

Fuentes:
Ink & Algorithms (AI Weekly Pulse): https://inkandalgorithms.systeme.io/ai-weekly-pulse-4-ai-model-releases-july-2026

Continue Reading

TENDENCIAS