Connect with us

Publicado

on

Los modelos de visión-lenguaje (VLMs) y la generación de contenido 4D están revolucionando la interacción de las máquinas con entornos complejos y dinámicos. Los VLMs integran el procesamiento de imágenes y texto, permitiendo a los sistemas de inteligencia artificial (IA) interpretar información visual y responder a instrucciones lingüísticas de forma simultánea. Por ejemplo, un robot puede identificar un objeto en una escena y seguir órdenes como «toma la caja azul de la mesa». La generación de contenido 4D, por su parte, extiende el modelado 3D (altura, ancho, profundidad) al incorporar el tiempo como cuarta dimensión, capturando cambios dinámicos en objetos o escenas. Esto es fundamental para aplicaciones interactivas como robótica, realidad aumentada (AR), realidad virtual (VR) y simulaciones avanzadas.

Un avance destacado en este campo es el paper «Streaming 4D Visual Geometry Transformer» (StreamVGGT), publicado el 15 de julio de 2025, por Dong Zhuo, Wenzhao Zheng, Jiahe Guo, Yuqi Wu, Jie Zhou y Jiwen Lu en arXiv. Este trabajo presenta un modelo innovador para la reconstrucción 4D en tiempo real, optimizado para procesar secuencias de video de manera eficiente. A continuación, se explora en detalle este modelo, su evolución desde enfoques anteriores, sus aplicaciones prácticas y el contexto de los VLMs y la generación 4D.

¿Qué es el Streaming 4D Visual Geometry Transformer?

El StreamVGGT es una arquitectura de transformador causal diseñada para reconstruir geometrías 4D (3D + tiempo) a partir de secuencias de video en tiempo real. A diferencia de los modelos tradicionales, que requieren reprocesar toda una secuencia de video cada vez que se añade un nuevo fotograma, StreamVGGT utiliza un enfoque de procesamiento incremental basado en atención causal temporal y un módulo de memoria implícita. Esto permite que el modelo solo considere los fotogramas pasados y actuales, imitando la percepción humana del mundo en tiempo real, lo que reduce significativamente el costo computacional y habilita actualizaciones continuas de la escena.

Componentes clave del StreamVGGT

  1. Codificador de imágenes: Procesa los fotogramas de entrada para extraer características visuales ricas, como texturas y formas.
  2. Decodificador espacio-temporal: Integra información espacial (3D) y temporal para generar representaciones 4D coherentes, como mapas de profundidad o trayectorias de objetos.
  3. Cabezas de predicción multitarea: Permiten realizar múltiples tareas simultáneamente, como estimar la geometría de una escena, predecir el movimiento de objetos o generar mapas de profundidad.
  4. Atención causal temporal: Restringe la atención a fotogramas anteriores, evitando la acumulación de errores a largo plazo, un problema común en modelos causales.
  5. Entrenamiento basado en destilación: Utiliza un modelo preentrenado, el Visual Geometry Grounded Transformer (VGGT), para transferir conocimiento y mejorar la precisión del modelo causal, optimizando el proceso de entrenamiento.

Innovaciones técnicas

El StreamVGGT introduce varias mejoras respecto a modelos anteriores:

  • Procesamiento en streaming: A diferencia de los métodos tradicionales que procesan videos completos, StreamVGGT maneja flujos de datos en tiempo real, crucial para aplicaciones como la navegación robótica.
  • Eficiencia computacional: La atención causal y el módulo de memoria implícita reducen el uso de recursos, permitiendo su implementación en dispositivos con capacidad limitada, como robots o gafas AR.
  • Robustez en entornos dinámicos: El modelo puede adaptarse a cambios rápidos en la escena, como objetos en movimiento o variaciones de iluminación, gracias a su diseño incremental.

Evolución de los Modelos: Del 3D al 4D y la Integración con VLMs

El desarrollo del StreamVGGT no surge de forma aislada, sino que se basa en una evolución progresiva de los modelos de visión computacional y VLMs. A continuación, se describe esta trayectoria:

  1. Modelos 2D y visión tradicional (antes de 2020):
    • Los primeros modelos de visión computacional, como las redes convolucionales (CNNs), se centraban en tareas 2D, como clasificación de imágenes o detección de objetos. Estos modelos no integraban información temporal ni lingüística, limitando su capacidad para aplicaciones interactivas.
    • Ejemplo: Modelos como ResNet (2015) eran eficientes para tareas estáticas, pero no podían manejar secuencias dinámicas o contexto lingüístico.
  2. Modelos 3D y primeros VLMs (2020-2023):
    • Con el auge de los transformadores (introducidos en 2017 con el paper «Attention is All You Need»), surgieron modelos capaces de procesar datos 3D, como nubes de puntos o mallas, para reconstruir geometrías estáticas de escenas.
    • Los primeros VLMs, como CLIP (2021), combinaron visión y lenguaje, permitiendo tareas como la generación de descripciones de imágenes o la búsqueda visual basada en texto.
    • Limitaciones: Estos modelos eran estáticos, procesaban imágenes o videos completos y no podían manejar datos en tiempo real o cambios temporales.
  3. Modelos 4D y VLMs avanzados (2023-2025):
    • En 2023, comenzaron a surgir modelos 4D que integraban el tiempo, como los basados en representaciones implícitas (NeRFs) para generar escenas dinámicas. Sin embargo, estos modelos eran computacionalmente costosos y no aptos para tiempo real.
    • En marzo de 2025, se presentó el Visual Geometry Grounded Transformer (VGGT), un modelo galardonado en CVPR 2025 que predice atributos 3D (como geometría y profundidad) a partir de imágenes estáticas. Aunque avanzado, el VGGT no estaba diseñado para procesar secuencias dinámicas en tiempo real.
    • Los VLMs evolucionaron para integrar percepción 3D y razonamiento, como en modelos como 3D-VLA, que combinan datos 3D con instrucciones lingüísticas para tareas robóticas.
  4. StreamVGGT y el futuro (2025 en adelante):
    • El StreamVGGT, basado en el VGGT, marca un hito al extender las capacidades al procesamiento 4D en tiempo real. Su enfoque de streaming y atención causal lo hace ideal para aplicaciones interactivas, superando las limitaciones de los modelos estáticos o no causales.
    • La integración de VLMs con modelos 4D, como StreamVGGT, permite sistemas que no solo reconstruyen escenas dinámicas, sino que también responden a instrucciones lingüísticas, como en robótica humanoide o AR.

Esta evolución refleja un cambio hacia modelos más integrados, eficientes y capaces de operar en entornos dinámicos, combinando visión, lenguaje y tiempo de manera fluida.

Aplicaciones Prácticas del StreamVGGT y los VLMs

El StreamVGGT y los VLMs tienen un impacto significativo en múltiples sectores debido a su capacidad para procesar datos visuales y lingüísticos en tiempo real:

  1. Robótica:
    • Robots humanoides: Empresas como Helix o startups en robótica médica usan VLMs para permitir que los robots interpreten instrucciones verbales y manipulen objetos en entornos complejos, como asistencia en hogares o quirófanos.
    • Vehículos autónomos: Modelos como OpenDriveVLA y ORION integran VLMs con percepción 4D para navegar en entornos urbanos, interpretando señales, obstáculos y comandos en tiempo real.
    • Agricultura: Robots agrícolas utilizan VLMs y modelos 4D para tareas como cosecha automatizada, monitoreo de cultivos o detección de plagas, mejorando la eficiencia y sostenibilidad.
    • Manufactura: En fábricas, los VLMs y modelos 4D facilitan el ensamblaje de precisión, la inspección de calidad y la colaboración entre humanos y máquinas.
  2. Realidad Aumentada (AR) y Realidad Virtual (VR):
    • Navegación AR: Empresas tecnológicas desarrollan aplicaciones para gafas AR o dispositivos móviles que usan VLMs para superponer información visual (como flechas de navegación) basada en instrucciones verbales o textuales.
    • Construcción: Sistemas como Visual Construction Safety Query (VCSQ) integran VLMs con AR para alertar a los trabajadores sobre riesgos en tiempo real, mejorando la seguridad en obras.
    • Simulaciones: Los modelos 4D como StreamVGGT generan entornos dinámicos para simuladores, útiles para entrenar robots o probar aplicaciones VR/AR.
  3. Investigación y Desarrollo:
    • Centros académicos: Universidades como Tsinghua y eventos como Robo-3DVLM exploran la integración de VLMs y modelos 4D para avanzar en tareas como la manipulación robótica en entornos desconocidos.
    • Startups de IA: Empresas emergentes desarrollan modelos como RoboPoint, que usan VLMs para predecir puntos de acción en robótica y AR, reduciendo la dependencia de grandes conjuntos de datos reales.

Contexto y Relevancia

El StreamVGGT se alinea con la tendencia de los modelos de lenguaje grandes autoregresivos, adaptando su filosofía a la visión computacional. Su capacidad para procesar datos en streaming lo distingue de enfoques anteriores, como el VGGT, que eran estáticos. Además, su diseño eficiente lo hace viable para dispositivos con recursos limitados, como robots o sistemas AR portátiles. Este modelo representa un paso hacia sistemas de IA más autónomos y responsivos, capaces de operar en entornos dinámicos del mundo real.

Uso Actual y Futuro

Hoy en día, los VLMs y la generación 4D están siendo adoptados por:

  • Industria tecnológica: Para desarrollar aplicaciones AR/VR inmersivas.
  • Sector automotriz: En sistemas de conducción autónoma que combinan percepción 4D y razonamiento lingüístico.
  • Agricultura y manufactura: Para automatización de tareas complejas.
  • Investigación académica: Para explorar nuevas fronteras en robótica y percepción 4D.

En el futuro, se espera que estos modelos se integren aún más con sistemas de IA multimodal, permitiendo interacciones más naturales entre humanos, máquinas y entornos dinámicos. Por ejemplo, un robot podría recibir instrucciones verbales, reconstruir una escena 4D en tiempo real y ejecutar tareas complejas sin intervención humana.

El «Streaming 4D Visual Geometry Transformer» es un avance clave en la reconstrucción 4D en tiempo real, construido sobre la evolución de los modelos de visión computacional y VLMs. Desde las CNNs 2D hasta los transformadores 4D, esta trayectoria muestra cómo la IA ha pasado de procesar imágenes estáticas a manejar entornos dinámicos con integración de lenguaje. Con aplicaciones en robótica, AR, VR y más, el StreamVGGT y los VLMs están allanando el camino hacia sistemas más inteligentes, eficientes y adaptativos, con un impacto transformador en múltiples industrias.

Fuente: Zhuo, D., Zheng, W., Guo, J., Wu, Y., Zhou, J., & Lu, J. (2025). Streaming 4D Visual Geometry Transformer. arXiv preprint arXiv:2507.11539. Disponible en: https://arxiv.org/abs/2507.11539https://wzzheng.net/StreamVGGT/

Continue Reading
Advertisement
Click to comment

Leave a Reply

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

AI

Agentes de IA en 2026: el año en que dejaron de ser demos y se volvieron infraestructura

Publicado

on

Gartner proyecta que para fin de 2026 el 40% de las apps empresariales van a incorporar agentes IA con tareas específicas, contra menos del 5% en 2025. En Argentina, el salto ya se siente: de la teoría de «arquitecturas multiagente» a un estándar de conexión real que corre en producción. Repasamos qué cambió y qué significa para quien está armando su propio sistema hoy.


El salto que no fue gradual

Hace apenas dos años, hablar de «arquitecturas multiagente» era terreno de papers y ebooks técnicos: diagramas de agentes con memoria, herramientas y patrones de coordinación (router, jerárquico, secuencial, paralelo) que sonaban más a diseño de software que a algo que una empresa mediana pudiera correr en producción. Ese material sigue siendo válido — la gramática no cambió —, pero en 2026 dejó de ser el tema central. Lo que pasó a ocupar ese lugar es la pregunta de cómo se conectan esos agentes entre sí y con las herramientas reales de una empresa, sin que cada integración sea un desarrollo a medida.

Gartner lo puso en números: los agentes de IA para tareas específicas van a pasar de estar en menos del 5% de las aplicaciones empresariales en 2025 a un 40% para fines de 2026. No es adopción incremental — es el tipo de salto que reordena qué vale la pena construir hoy.

MCP: el estándar que resolvió el problema de fondo

El obstáculo real de un sistema multiagente nunca fue diseñar los patrones de coordinación — eso ya estaba resuelto conceptualmente. El obstáculo era conectar cada modelo con cada herramienta externa (una base de datos, un CRM, el sistema de archivos) sin que cada combinación exigiera su propio desarrollo a medida. Anthropic publicó el Model Context Protocol (MCP) a fines de 2024 como respuesta a ese problema — un estándar abierto para que cualquier agente hable con cualquier herramienta sin integración a medida — pero en 2026 pasó de propuesta a infraestructura real: gobernanza abierta bajo la Fundación Linux, adopción de OpenAI, Google DeepMind, Databricks y Salesforce, y más de 10.000 servidores MCP públicos ya disponibles a comienzos de año. La comparación que más se repite es la correcta: es el USB-C de la IA — un conector único en lugar de un cable distinto para cada combinación de modelo y herramienta.

La agenda que Anthropic viene marcando para lo que resta de 2026 — autenticación empresarial vía OAuth y SSO, permisos por rol, auditoría de qué hizo cada agente y por qué — es la parte que ningún material de 2024 podía anticipar, porque son problemas que solo aparecen cuando el sistema ya está en producción con datos reales, no en un demo.

Argentina, en la mitad de la curva

Los números de adopción en la región conviene leerlos con la salvedad de que cada estudio mide distinto (algunos hablan de «usa IA» en sentido amplio, otros de agentes autónomos específicamente), pero la dirección es consistente: Argentina aparece entre los países de mayor adopción de IA de la región, con estimaciones que van del 29% al 68% según la métrica y la fuente. Al mismo tiempo, un dato de la Universidad Siglo 21 marca la brecha real: el 76% de las tareas en empresas argentinas tiene potencial de automatización, pero menos del 15% de las PyMEs implementó algo concreto todavía. Ahí está la oportunidad — no en la tecnología en sí, sino en cerrar esa distancia.

El stack que domina esa implementación en Argentina hoy es, según relevamientos de consultoras locales, la combinación de n8n como orquestador con la API de un modelo como Claude o GPT-4 para la generación — el mismo patrón «monitor de fuentes → agente redactor → aprobación humana → publicación» que sirve tanto para automatizar un ecosistema editorial como para un bot de atención al cliente o un sistema de gestión interno. La arquitectura es la misma; lo que cambia es a qué herramientas se conecta cada agente.

Lo que esto significa para armar un sistema propio hoy

Si el objetivo es una arquitectura multiagente real y no un diagrama, el orden de prioridades cambió respecto a hace un año: primero definir qué conecta con qué (¿hay servidores MCP ya armados para las herramientas que vas a usar, o hay que construir la integración?), después elegir el patrón de coordinación (secuencial alcanza para la mayoría de los pipelines de contenido; jerárquico tiene sentido recién cuando hay múltiples fuentes y decisiones de enrutamiento no triviales), y recién al final optimizar el prompt de cada agente individual. Es el orden inverso al que proponía la generación de guías de 2024, que empezaban por los patrones y dejaban la conectividad como detalle de implementación — hoy la conectividad es la decisión que más condiciona todo lo demás.


Fuentes:

  • Gartner, proyección de adopción de agentes IA en apps empresariales 2025→2026
  • Anthropic — anuncio y roadmap del Model Context Protocol (MCP), 2024-2026
  • Linux Foundation — gobernanza abierta de MCP, 2026
  • ebankingnews.com — «Adopción de IA en 2026: Liderazgo Global y Avance de LatAm» (jul-2026)
  • ecosistemastartup.com — «IA empresarial 2026: 95% de empresas la adoptan» (abr-2026)
  • Universidad Siglo 21 / Duotach — «Top 5 Consultoras de IA en Argentina 2026» (jun-2026)
  • diegoceredi.com — «Agentes autónomos 2026: el mapa para empresas argentinas» (jun-2026)
  • Weaviate — ebook «Agentic Architectures for retrieval-intensive applications» (fundamentos y patrones)

Continue Reading

AI

Andrew Ng lanza OpenWorker, un agente de IA de código abierto

Publicado

on

Andrew Ng presentó OpenWorker, un agente de inteligencia artificial de código abierto que no se limita a chatear con el usuario, sino que entrega trabajo terminado: documentos redactados, mensajes de Slack enviados o eventos de calendario actualizados. El anuncio lo hizo el propio Ng junto a su socio Rohit Prasad, y la herramienta ya está disponible para descargar en Mac, con versión para Windows en camino.

El producto llega en un momento en que la carrera por los agentes de IA se acelera en todo el mundo, y Argentina no queda al margen de esa tendencia. OpenWorker funciona como una aplicación de escritorio construida con Tauri 2 y una interfaz en React, que se comunica con un servidor local en Python montado sobre FastAPI. A diferencia de otros asistentes que dependen de un servicio de inferencia propio, esta herramienta no tiene modelo propietario: el usuario debe traer su propia clave de API y elegir entre proveedores como OpenAI, Google o Anthropic, o bien optar por modelos de peso abierto como GLM, DeepSeek o Kimi, e incluso correr todo de forma local con Ollama para que los datos nunca salgan de la máquina.

El anuncio generó movimiento inmediato en el ecosistema de desarrolladores y en las redes de discusión tecnológica, donde OpenWorker fue comparado con otros agentes de escritorio que compiten por resolver tareas de oficina de punta a punta. El motor de la herramienta se apoya en aisuite, la biblioteca de enrutamiento de modelos que el propio Ng viene desarrollando, lo que le permite a las empresas alternar entre proveedores sin reescribir el código de sus flujos de trabajo. El repositorio publicado en GitHub suma más de 30 mil líneas de código en Python y una capa de permisos que clasifica cada acción del agente en cuatro niveles de riesgo, desde una simple lectura de archivos hasta una acción externa que requiere aprobación explícita del usuario antes de ejecutarse.

De cara a los próximos meses, el lanzamiento profundiza una discusión que ya venía instalada en la industria: si conviene depender de agentes cerrados y gestionados por una nube, o si el camino es hacia herramientas abiertas que corren en la computadora del usuario y solo se conectan a un proveedor de modelos cuando hace falta. No faltaron las voces críticas, que señalaron que aun con el código abierto, la dependencia de las claves de API de gigantes como OpenAI o Anthropic mantiene atada a la herramienta a esos mismos proveedores. Para los equipos de desarrollo y las empresas que evalúan sumar agentes a sus procesos, OpenWorker aparece como una alternativa concreta, gratuita y auditable, aunque con una barrera de entrada más alta que la de un asistente listo para usar: hay que instalar la aplicación, configurar las claves y, por ahora, contar con una computadora Mac.

Fuentes:

MarkTechPost: https://www.marktechpost.com/2026/07/23/andrew-ng-just-released-openworker-an-open-source-local-first-desktop-ai-coworker-that-returns-finished-deliverables-instead-of-chat/

Blockchain.News: https://blockchain.news/ainews/openworker-launches-open-source-agent-that-ships-work

Publicación de Andrew Ng en X: https://x.com/AndrewYNg/status/2080333504446108104

MoClaw Blog: https://moclaw.ai/blog/what-is-openworker

APIMart: https://apimart.ai/blog/openworker-andrew-ng-open-source-agents-deliver

Continue Reading

AI

Google lanza Gemini 3.6 Flash y acelera la carrera por modelos más rápidos y económicosddd

Publicado

on

Google presentó Gemini 3.6 Flash, la actualización más reciente de su línea de modelos livianos, orientada a aplicaciones que priorizan velocidad de respuesta y menor costo por consulta sobre el máximo poder de razonamiento. El lanzamiento se suma a una seguidilla de anuncios de modelos de frontera durante julio, en un momento en que la industria de la IA se mueve cada vez más hacia familias de modelos especializados por tarea y presupuesto, en lugar de apostar a un único modelo insignia.

Gemini 3.6 Flash se ubica dentro de la estrategia de Google de ofrecer variantes de distinto tamaño y costo computacional dentro de una misma familia, de forma similar a como OpenAI dividió su línea GPT-5.6 en versiones orientadas a razonamiento de alto nivel y versiones más económicas para tareas de uso masivo. Para desarrolladores empresariales, contar con una versión «Flash» actualizada significa poder desplegar asistentes conversacionales, herramientas de clasificación de datos o agentes de bajo costo sin necesidad de recurrir a los modelos más caros de la familia Gemini para cada tarea.

El lanzamiento se produce en un contexto de fuerte presión de precios en toda la industria: en julio se sucedieron los debuts de Grok 4.5 de xAI, la familia GPT-5.6 de OpenAI y modelos abiertos como Kimi K3 y Muse Spark 1.1, todos compitiendo por ofrecer más capacidad a menor costo por token. Analistas del sector describen este movimiento como el inicio de una verdadera guerra de precios en inferencia, en la que el costo de ejecutar inteligencia de frontera cae a un ritmo comparable al de una ley de Moore acelerada.

Para el usuario final, la multiplicación de modelos rápidos y económicos como Gemini 3.6 Flash se traduce en asistentes de IA integrados en más productos cotidianos —desde buscadores hasta aplicaciones móviles— sin los costos de latencia y factura que implicaban los modelos de mayor tamaño. La contracara es una industria cada vez más fragmentada, en la que elegir el modelo correcto para cada tarea específica se vuelve una decisión técnica y económica central para empresas y desarrolladores, y en la que la velocidad de iteración deja cada vez menos margen para el análisis pausado de riesgos de seguridad de cada nuevo lanzamiento.

Fuentes:
AI Release Tracker: https://aireleasetracker.com/latest
AIapps (July 2026 AI Mega-Update): https://www.aiapps.com/blog/july-ai-mega-update-major-breakthroughs-launches/

Continue Reading

TENDENCIAS