Connect with us

Publicado

on

Introducción

En junio de 2025, Apple publicó un estudio innovador titulado «The Illusion of Thinking: Understanding the Strengths and Limitations of Reasoning Models via the Lens of Problem Complexity». Este trabajo ha generado un debate significativo en la comunidad de inteligencia artificial al cuestionar la capacidad de los Large Reasoning Models (LRMs) para razonar de manera genuina. En lugar de un razonamiento lógico, el estudio sugiere que estos modelos dependen de un reconocimiento de patrones sofisticado. Este informe explora en profundidad los hallazgos del estudio, analiza críticas y perspectivas alternativas, propone mejoras potenciales para contrarrestar las limitaciones identificadas y ofrece una visión para el futuro de la investigación en IA.

¿Qué son los Large Reasoning Models?

Los LRMs son una evolución de los Large Language Models (LLMs), diseñados para abordar problemas complejos mediante un razonamiento estructurado. Modelos como OpenAI o1, o3-mini, DeepSeek-R1, Claude-3.7-Sonnet-Thinking y Google’s Thinking models utilizan técnicas como la «cadena de pensamiento» (Chain-of-Thought, CoT) y la autorreflexión para generar respuestas más deliberadas. A diferencia de los LLMs, que se centran en predecir palabras basándose en patrones, los LRMs intentan simular un proceso de pensamiento lógico, lo que los hace prometedores para tareas que requieren descomposición de problemas.

Hallazgos Clave del Paper de Apple

El estudio de Apple evaluó LRMs en entornos de rompecabezas controlados, como la Torre de Hanói, el Cruce del Río y el Mundo de Bloques, que permiten manipular la complejidad manteniendo estructuras lógicas consistentes. Los resultados destacan varias limitaciones:

1. Colapso de Precisión

Todos los LRMs evaluados mostraron una caída total en precisión más allá de un umbral de complejidad, independientemente del tamaño del modelo o los recursos disponibles. Por ejemplo, en la Torre de Hanói con 20 discos, los modelos no lograron generar soluciones correctas.

2. Límite de Escalado Contraintuitivo

El esfuerzo de razonamiento, medido por el uso de tokens de inferencia, aumentaba con la complejidad del problema hasta un punto crítico. Más allá de este umbral, los modelos reducían su esfuerzo, utilizando menos tokens, como si se sintieran «superados» por la tarea, a pesar de tener un presupuesto de tokens adecuado.

3. Regímenes de Rendimiento

Al comparar LRMs con LLMs estándar bajo el mismo cómputo de inferencia, se identificaron tres regímenes:

  • Baja Complejidad: Los LLMs estándar superaron a los LRMs, utilizando menos recursos y logrando mayor precisión.
  • Media Complejidad: Los LRMs mostraron una ventaja, ya que sus pasos de «pensamiento» adicional les permitieron resolver problemas de manera más efectiva.
  • Alta Complejidad: Ambos tipos de modelos colapsaron, con una precisión que caía a cero.
RégimenRendimiento RelativoEjemplo
Baja ComplejidadLLMs > LRMs (menos recursos, más precisión)Torre de Hanói con 1 disco
Media ComplejidadLRMs > LLMs (ventaja del razonamiento)Torre de Hanói con 8-9 discos
Alta ComplejidadAmbos fallan (precisión 0%)Torre de Hanói con 20 discos

4. Limitaciones en Cálculos Exactos

Los LRMs no aplicaron algoritmos explícitos de manera confiable, incluso cuando se les proporcionaron. Por ejemplo, en el Cruce del Río, los modelos a menudo ignoraban restricciones lógicas, proponiendo soluciones ilógicas.

5. Análisis de Trazas de Razonamiento

El análisis de las trazas internas de razonamiento reveló que los LRMs no seguían caminos lógicos consistentes, sino que saltaban a conclusiones basadas en patrones aprendidos. Esto refuerza la idea de que su «razonamiento» es más una imitación que un proceso lógico genuino.

Ejemplos de Fallos en Rompecabezas

El estudio utilizó varios rompecabezas para evaluar los LRMs:

  • Torre de Hanói: Los modelos resolvieron configuraciones simples (pocos discos), pero colapsaron en configuraciones con 20 discos, que requieren 1,048,575 movimientos.
  • Cruce del Río: En este problema, donde se deben transportar objetos respetando restricciones (por ejemplo, un lobo y una cabra no pueden quedarse solos), los LRMs fallaron en configuraciones con solo 5 movimientos, mostrando inconsistencia.
  • Mundo de Bloques: Los modelos tuvieron dificultades para planificar secuencias largas de movimientos, especialmente en configuraciones complejas.
  • Salto de Damas: Similar a un juego de damas, los LRMs no lograron mantener consistencia en problemas que requerían múltiples movimientos lógicos.

Críticas y Perspectivas Alternativas

El paper de Apple ha recibido críticas, particularmente de Sean Goedecke en su blog «The illusion of ‘The Illusion of Thinking'». Goedecke argumenta que los rompecabezas utilizados podrían no ser ideales para evaluar el razonamiento, ya que las soluciones (como la de la Torre de Hanói con 10 discos) están ampliamente disponibles en línea, lo que sugiere una posible contaminación de datos de entrenamiento. Él propone que los LRMs podrían rendir mejor en tareas para las que fueron entrenados, como problemas matemáticos o de codificación.

Goedecke también cuestiona la interpretación del límite de escalado. Sugiere que la reducción de esfuerzo en tareas complejas podría ser una decisión estratégica, no una incapacidad. Por ejemplo, en la Torre de Hanói con 10 discos (1023 movimientos), un modelo podría optar por buscar atajos en lugar de enumerar todos los pasos, lo que no necesariamente indica una falta de razonamiento.

Además, Goedecke desafía la conclusión de que los modelos no razonan más allá de un umbral de complejidad. Compara esto con el razonamiento humano, que también tiene límites, pero aún se considera razonamiento. Argumenta que si un modelo puede razonar a través de 10 pasos, pero no 11, sigue demostrando capacidad de razonamiento.

Verificación de los Hallazgos

Sander Ali Khowaja, en su artículo en Medium «An Examination of Apple’s ‘The Illusion of Thinking'», verifica los hallazgos del paper de Apple. Confirma:

  • El colapso de precisión en problemas complejos.
  • La reducción de esfuerzo de razonamiento en tareas de alta complejidad.
  • Los tres regímenes de rendimiento.
  • La inconsistencia en el razonamiento, como resolver la Torre de Hanói con más de 100 movimientos, pero fallar en el Cruce del Río con 5 movimientos.

Khowaja también destaca las implicaciones éticas, señalando que las explicaciones fluidas de los LRMs pueden generar una falsa percepción de competencia, lo que podría llevar a una sobredependencia en aplicaciones críticas.

Mejoras Potenciales para Contrarrestar las Limitaciones

Para abordar las limitaciones técnicas identificadas, se proponen las siguientes mejoras, diseñadas para optimizar el rendimiento de los LRMs y acercarlos a un razonamiento más robusto y generalizable:

  1. Dependencia de Patrones en Lugar de Razonamiento Algorítmico
    • Problema: Los LRMs dependen de patrones estadísticos en lugar de ejecutar algoritmos formales.
    • Mejora Potencial:
      • Integración de Módulos Simbólicos: Combinar transformadores con motores de inferencia lógica (e.g., sistemas expertos o solvers SAT) para ejecutar algoritmos explícitos. Por ejemplo, un módulo dedicado podría resolver la Torre de Hanói recursivamente usando la fórmula ( 2^n – 1 ).
      • Entrenamiento con Datos Sintéticos: Generar datasets sintéticos que enseñen a los modelos a seguir procesos algorítmicos paso a paso, reduciendo la dependencia de patrones memorizados.
    • Impacto Esperado: Permitiría a los LRMs aplicar reglas lógicas consistentes, mejorando el rendimiento en problemas estructurados.
  2. Colapso de Precisión en Alta Complejidad
    • Problema: La precisión cae a cero en problemas con espacios de búsqueda profundos (e.g., ( O(2^k) ) en el Cruce del Río).
    • Mejora Potencial:
      • Atención Optimizada: Implementar mecanismos de atención dispersa o lineal (e.g., Linformer, con complejidad ( O(n) )) para manejar contextos largos sin pérdida de información.
      • Búsqueda Guiada: Integrar algoritmos de búsqueda clásicos (e.g., A*, búsqueda en profundidad) en la arquitectura para explorar soluciones en problemas combinatorios.
    • Impacto Esperado: Mejoraría la capacidad de planificar secuencias largas, manteniendo la precisión en tareas complejas.
  3. Límite de Escalado Contraintuitivo
    • Problema: Los modelos reducen el uso de tokens en problemas muy complejos, «rindiéndose».
    • Mejora Potencial:
      • Meta-Razonamiento Dinámico: Desarrollar un módulo de meta-aprendizaje que evalúe la dificultad del problema (e.g., estimando la profundidad del espacio de búsqueda) y ajuste dinámicamente el cómputo, asignando más tokens o iteraciones según sea necesario.
      • Refuerzo para Persistencia: Usar aprendizaje por refuerzo con recompensas que incentiven la exploración exhaustiva en problemas difíciles, en lugar de optimizar solo la eficiencia.
    • Impacto Esperado: Los modelos persistirían en tareas complejas, utilizando recursos de manera más efectiva.
  4. Inconsistencia en el Razonamiento
    • Problema: El rendimiento varía con cambios superficiales en la redacción o valores.
    • Mejora Potencial:
      • Representaciones Abstractas: Incorporar estructuras como grafos o árboles de decisión para modelar la lógica subyacente del problema, en lugar de depender solo del texto.
      • Entrenamiento Robusto: Exponer a los modelos a variaciones sistemáticas (e.g., cambios en nombres, números) durante el entrenamiento para mejorar la generalización.
    • Impacto Esperado: Reduciría la sensibilidad a variaciones superficiales, asegurando un razonamiento más consistente.
  5. Fragilidad ante Distracciones
    • Problema: Información irrelevante degrada la precisión (e.g., 65% de caída con cláusulas distractoras).
    • Mejora Potencial:
      • Filtrado de Contexto: Implementar un preprocesador que identifique y descarte tokens irrelevantes antes de la inferencia, usando técnicas como análisis de relevancia basado en atención.
      • Atención Focalizada: Modificar los mecanismos de atención para priorizar tokens relacionados con las restricciones lógicas del problema.
    • Impacto Esperado: Mejoraría la robustez en entornos ruidosos, como documentos del mundo real.
  6. Limitaciones en el Diseño de la Arquitectura
    • Problema: Los transformadores carecen de estado dinámico y escalado para razonamiento secuencial.
    • Mejora Potencial:
      • Módulos de Estado Dinámico: Integrar componentes como redes neuronales recurrentes (RNN) o memorias externas (e.g., Neural Turing Machines) para rastrear estados intermedios durante el razonamiento.
      • Hibridación: Combinar transformadores con sistemas simbólicos o algoritmos clásicos para manejar tareas combinatorias y de planificación.
    • Impacto Esperado: Permitiría un razonamiento secuencial y combinatorio más robusto, superando las limitaciones estructurales.

Implicaciones para la Inteligencia Artificial General

Los hallazgos sugieren que los LRMs no están cerca de alcanzar la inteligencia artificial general (AGI). Su dependencia de patrones y su incapacidad para generalizar el razonamiento a través de diferentes tipos de problemas indican que las arquitecturas actuales tienen limitaciones fundamentales. Esto plantea preguntas sobre cómo avanzar hacia una IA más robusta y generalizable.

Visión a Futuro

El estudio de Apple y las discusiones posteriores destacan varias direcciones para la investigación futura en IA:

  1. Métodos de Evaluación Más Robustos: Los benchmarks actuales, como los de matemáticas y codificación, pueden estar contaminados. Se necesitan nuevos métodos que evalúen el razonamiento genuino y analicen las trazas internas de los modelos.
  2. Arquitecturas Híbridas: Combinar redes neuronales con métodos computacionales tradicionales, como la síntesis de programas o los Large Concept Models de Meta, podría superar las limitaciones actuales.
  3. Técnicas de Entrenamiento Mejoradas: Métodos como el aprendizaje por refuerzo para el razonamiento intercalado podrían fomentar una mayor persistencia en problemas complejos y una mejor aplicación de algoritmos explícitos.
  4. Consideraciones Éticas: Es crucial abordar el riesgo de sobredependencia en modelos que parecen competentes pero carecen de comprensión real. La transparencia sobre las capacidades y limitaciones de los modelos es esencial.
  5. Razonamiento Generalizable: La investigación futura debe enfocarse en desarrollar modelos que puedan razonar de manera consistente en diferentes dominios, acercándose a la AGI.

Conclusión

El paper de Apple «The Illusion of Thinking» revela que los LRMs, aunque avanzados, no razonan como los humanos, sino que dependen de patrones aprendidos. Las críticas, como las de Goedecke, sugieren que los métodos de evaluación y las interpretaciones deben ser más matizadas. Las mejoras propuestas—arquitecturas híbridas, meta-razonamiento, representaciones abstractas y entrenamiento robusto—pueden contrarrestar estas limitaciones, allanando el camino hacia modelos más confiables. Al abordar estas áreas, la comunidad de IA puede avanzar hacia una inteligencia artificial más robusta, ética y generalizable, acercándose al objetivo de la AGI.

Key Citations

  • Apple Machine Learning Research: The Illusion of Thinking
  • Sean Goedecke’s Blog: The illusion of «The Illusion of Thinking»
  • Sander Ali Khowaja on Medium: An Examination of Apple’s “The Illusion of Thinking”

Continue Reading
Advertisement
Click to comment

Leave a Reply

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

AI

Ecosistema Actual de IA Generativa – RAG, Agentes, Agentic RAG y los Principales Actores – Agosto 2026

Publicado

on


La inteligencia artificial generativa ha dejado atrás la etapa en la que un simple modelo de lenguaje bastaba para resolver la mayoría de los problemas. Hoy el valor real se encuentra en la composición de varias capas especializadas que trabajan juntas: modelos base, técnicas de recuperación de información, agentes autónomos, frameworks de orquestación y runtimes listos para producción. Esta nota explica de forma continua y técnica cada una de estas capas, sitúa a los actores principales en su lugar exacto dentro del stack y muestra cómo convergen en sistemas reales. El objetivo es ofrecer una visión clara, funcional y actualizada para quienes diseñan o implementan soluciones de IA en entornos productivos.

Los modelos de lenguaje como base de razonamiento

Todo el ecosistema se apoya en los grandes modelos de lenguaje. Estos modelos son el motor de razonamiento y generación de texto. Claude, de Anthropic, destaca por su capacidad de razonamiento profundo, uso de herramientas y funciones como Computer Use. Los modelos de la familia GPT de OpenAI siguen siendo una referencia de uso general. Los modelos Hermes, desarrollados por Nous Research, están optimizados especialmente para comportamientos agentic e instruction following. También existen opciones open-weight y locales que pueden ejecutarse con Ollama o vLLM. Ninguno de estos modelos, por sí solo, tiene acceso nativo a datos privados actualizados ni capacidad de ejecutar acciones de forma persistente. Por eso necesitan de las capas que se describen a continuación.

RAG como técnica de grounding

Retrieval-Augmented Generation, o RAG, surgió como la solución más directa al problema de las alucinaciones y del conocimiento estático de los modelos. El flujo clásico consiste en convertir la pregunta del usuario en un embedding, buscar los fragmentos más similares en una base vectorial, inyectar esos fragmentos en el prompt y dejar que el modelo genere la respuesta. Esta técnica es eficiente, de bajo costo y latencia predecible. Funciona muy bien para consultas factuales simples sobre documentación interna, políticas de empresa o bases de conocimiento. Sin embargo, su naturaleza pasiva y de una sola pasada la hace insuficiente cuando la pregunta requiere conectar información de varias fuentes o razonar en varios pasos.

Los agentes de IA y el paso a la autonomía

Un agente de IA va más allá de generar texto. Opera en un bucle de razonamiento, acción y observación. Recibe un objetivo, decide qué herramientas utilizar, ejecuta acciones, observa los resultados y ajusta su plan hasta completar la tarea. Puede llamar APIs, consultar bases de datos, navegar por la web, ejecutar código o interactuar con sistemas externos. La diferencia fundamental con un sistema RAG puro es que el agente no solo responde: actúa y decide. Esta capacidad abre la puerta a la automatización de flujos de trabajo completos, desde la investigación hasta la ejecución de tareas operativas.

Agentic RAG: la fusión de recuperación y autonomía

Agentic RAG representa la convergencia natural entre la técnica de recuperación y la autonomía de los agentes. En esta arquitectura el agente controla el proceso de retrieval. Decide si necesita buscar información, reformula la consulta, elige entre varias fuentes, evalúa la calidad de lo recuperado y vuelve a buscar si es necesario. Solo genera la respuesta final cuando considera que tiene suficiente evidencia. Este enfoque resuelve las limitaciones del RAG clásico en consultas multi-hop y ambiguas, aunque introduce mayor latencia y costo por las múltiples llamadas al modelo. Es el patrón que se utiliza hoy en asistentes de investigación, sistemas de soporte técnico avanzado y análisis complejos que cruzan datos internos y externos.

Los frameworks de construcción: LangChain y LangGraph

Para construir estos sistemas de forma controlada y mantenible se utilizan frameworks de orquestación. LangChain ofrece abstracciones estándar para modelos, embeddings, vector stores, herramientas y agentes. Facilita el desarrollo de cadenas y la integración de múltiples componentes. LangGraph, construido sobre la misma base, permite modelar el flujo como un grafo de estados con persistencia, ejecución durable, human-in-the-loop y streaming. Es la herramienta preferida cuando se necesita control fino sobre el comportamiento del agente o sistemas multi-agente. Ambos son open-source y se han convertido en el estándar de facto para implementar Agentic RAG y arquitecturas agentic personalizadas.

Los runtimes de agentes listos para producción

Una vez que se tiene la lógica de orquestación, aparece la necesidad de ejecutar el agente de forma persistente y accesible. Aquí entran los runtimes. Hermes Agent, desarrollado por Nous Research, es un agente autónomo open-source con un learning loop incorporado. Crea skills a partir de la experiencia, mantiene memoria persistente entre sesiones y mejora con el tiempo. Puede ejecutarse en un servidor propio, en la nube o de forma serverless, y admite cualquier modelo, incluido Claude. OpenClaw, por su parte, se orienta más a la accesibilidad multi-canal. Corre en el dispositivo del usuario o en un servidor y se conecta de forma nativa a Telegram, WhatsApp, Discord, Slack e iMessage, entre otros. Ambos son MIT y gratuitos para self-hosting. Representan la capa de experiencia de usuario y persistencia operativa.

Cómo convergen todos estos elementos

La arquitectura moderna no elige entre RAG, agentes o frameworks. Los combina según la necesidad. Un sistema típico de producción puede tener a OpenClaw o Hermes como interfaz y runtime persistente, LangGraph como capa de orquestación y control de flujo, herramientas de Agentic RAG para la recuperación inteligente de conocimiento, y Claude u otro modelo potente como motor de razonamiento. El resultado es un sistema que puede recibir una instrucción por Telegram, decidir qué información necesita, recuperarla de varias fuentes, razonar sobre ella y ejecutar acciones, todo manteniendo contexto a lo largo del tiempo.

Criterios prácticos de decisión

Cuando la necesidad es únicamente responder preguntas sobre un corpus de documentos con baja latencia, el RAG clásico sigue siendo la opción más eficiente. Cuando las consultas son complejas o multi-fuente, se recomienda subir a Agentic RAG implementado con LangGraph. Si el objetivo es automatizar flujos de trabajo de extremo a extremo, se construye un agente con el mismo framework. Cuando se busca un asistente personal que esté siempre disponible y mejore con el uso, Hermes Agent o OpenClaw ofrecen una base sólida. Y cuando se requiere control total y personalización profunda, se desarrolla todo sobre LangChain y LangGraph.

Consideraciones de producción

En entornos reales adquiere especial importancia la observabilidad. Herramientas como LangSmith permiten trazar cada decisión del agente, medir costos y detectar fallos. El control de herramientas, el uso de sandboxes y la inclusión de human-in-the-loop son prácticas recomendadas para limitar riesgos. La memoria debe distinguirse entre la de sesión y la persistente de largo plazo. Finalmente, la evaluación debe ir más allá de la precisión de la respuesta e incluir métricas de trayectoria del agente y de fidelidad a las fuentes recuperadas.

Conclusión

El stack actual de IA generativa es una composición de capas especializadas. Los modelos aportan el razonamiento, RAG aporta el grounding, los agentes aportan la autonomía, los frameworks aportan el control y los runtimes aportan la persistencia y la accesibilidad. Entender el lugar exacto de cada actor permite diseñar sistemas más eficientes, controlables y alineados con el problema real que se quiere resolver. Esta convergencia es la base sobre la que se construyen hoy las aplicaciones de IA más avanzadas.


Fuentes y enlaces de descarga

LangChain Framework open-source (MIT). Gratis. Repositorio: https://github.com/langchain-ai/langchain Documentación: https://docs.langchain.com Instalación: pip install langchain o uv add langchain

LangGraph Framework de orquestación open-source (MIT). Gratis. Repositorio: https://github.com/langchain-ai/langgraph Documentación: https://docs.langchain.com/oss/python/langgraph/overview Instalación: pip install -U langgraph

Hermes Agent (Nous Research) Runtime de agente autónomo open-source (MIT). Gratis para self-hosting. Repositorio: https://github.com/NousResearch/hermes-agent Documentación e instalador: https://hermes-agent.nousresearch.com/docs/ Instalación rápida (Linux/macOS/WSL): curl -fsSL https://hermes-agent.nousresearch.com/install.sh | bash

OpenClaw Runtime/gateway de agente personal open-source (MIT). Gratis para self-hosting. Repositorio: https://github.com/openclaw/openclaw Sitio oficial: https://openclaw.ai Instalación rápida (Linux/macOS/WSL): curl -fsSL https://openclaw.ai/install.sh | bash

Claude (Anthropic) Modelo propietario. Existe plan gratuito limitado en claude.ai. API y planes Pro/Max son de pago. Sitio: https://claude.ai Documentación API y precios: https://docs.anthropic.com y https://www.anthropic.com/pricing

Referencias conceptuales adicionales

  • Documentación oficial de Agentic RAG y patrones: sitios de IBM, LangChain y papers de arXiv sobre Agentic Retrieval-Augmented Generation.
  • Comparativas y casos de uso de Hermes y OpenClaw: documentación oficial de ambos proyectos y análisis técnicos de 2026.

Todos los componentes open-source mencionados (LangChain, LangGraph, Hermes Agent y OpenClaw) pueden descargarse e instalarse de forma gratuita bajo licencia MIT. Los costos aparecen únicamente al utilizar APIs de modelos propietarios como Claude o al desplegar infraestructura en la nube.

Continue Reading

AI

Agentes de IA en 2026: el año en que dejaron de ser demos y se volvieron infraestructura

Publicado

on

Gartner proyecta que para fin de 2026 el 40% de las apps empresariales van a incorporar agentes IA con tareas específicas, contra menos del 5% en 2025. En Argentina, el salto ya se siente: de la teoría de «arquitecturas multiagente» a un estándar de conexión real que corre en producción. Repasamos qué cambió y qué significa para quien está armando su propio sistema hoy.


El salto que no fue gradual

Hace apenas dos años, hablar de «arquitecturas multiagente» era terreno de papers y ebooks técnicos: diagramas de agentes con memoria, herramientas y patrones de coordinación (router, jerárquico, secuencial, paralelo) que sonaban más a diseño de software que a algo que una empresa mediana pudiera correr en producción. Ese material sigue siendo válido — la gramática no cambió —, pero en 2026 dejó de ser el tema central. Lo que pasó a ocupar ese lugar es la pregunta de cómo se conectan esos agentes entre sí y con las herramientas reales de una empresa, sin que cada integración sea un desarrollo a medida.

Gartner lo puso en números: los agentes de IA para tareas específicas van a pasar de estar en menos del 5% de las aplicaciones empresariales en 2025 a un 40% para fines de 2026. No es adopción incremental — es el tipo de salto que reordena qué vale la pena construir hoy.

MCP: el estándar que resolvió el problema de fondo

El obstáculo real de un sistema multiagente nunca fue diseñar los patrones de coordinación — eso ya estaba resuelto conceptualmente. El obstáculo era conectar cada modelo con cada herramienta externa (una base de datos, un CRM, el sistema de archivos) sin que cada combinación exigiera su propio desarrollo a medida. Anthropic publicó el Model Context Protocol (MCP) a fines de 2024 como respuesta a ese problema — un estándar abierto para que cualquier agente hable con cualquier herramienta sin integración a medida — pero en 2026 pasó de propuesta a infraestructura real: gobernanza abierta bajo la Fundación Linux, adopción de OpenAI, Google DeepMind, Databricks y Salesforce, y más de 10.000 servidores MCP públicos ya disponibles a comienzos de año. La comparación que más se repite es la correcta: es el USB-C de la IA — un conector único en lugar de un cable distinto para cada combinación de modelo y herramienta.

La agenda que Anthropic viene marcando para lo que resta de 2026 — autenticación empresarial vía OAuth y SSO, permisos por rol, auditoría de qué hizo cada agente y por qué — es la parte que ningún material de 2024 podía anticipar, porque son problemas que solo aparecen cuando el sistema ya está en producción con datos reales, no en un demo.

Argentina, en la mitad de la curva

Los números de adopción en la región conviene leerlos con la salvedad de que cada estudio mide distinto (algunos hablan de «usa IA» en sentido amplio, otros de agentes autónomos específicamente), pero la dirección es consistente: Argentina aparece entre los países de mayor adopción de IA de la región, con estimaciones que van del 29% al 68% según la métrica y la fuente. Al mismo tiempo, un dato de la Universidad Siglo 21 marca la brecha real: el 76% de las tareas en empresas argentinas tiene potencial de automatización, pero menos del 15% de las PyMEs implementó algo concreto todavía. Ahí está la oportunidad — no en la tecnología en sí, sino en cerrar esa distancia.

El stack que domina esa implementación en Argentina hoy es, según relevamientos de consultoras locales, la combinación de n8n como orquestador con la API de un modelo como Claude o GPT-4 para la generación — el mismo patrón «monitor de fuentes → agente redactor → aprobación humana → publicación» que sirve tanto para automatizar un ecosistema editorial como para un bot de atención al cliente o un sistema de gestión interno. La arquitectura es la misma; lo que cambia es a qué herramientas se conecta cada agente.

Lo que esto significa para armar un sistema propio hoy

Si el objetivo es una arquitectura multiagente real y no un diagrama, el orden de prioridades cambió respecto a hace un año: primero definir qué conecta con qué (¿hay servidores MCP ya armados para las herramientas que vas a usar, o hay que construir la integración?), después elegir el patrón de coordinación (secuencial alcanza para la mayoría de los pipelines de contenido; jerárquico tiene sentido recién cuando hay múltiples fuentes y decisiones de enrutamiento no triviales), y recién al final optimizar el prompt de cada agente individual. Es el orden inverso al que proponía la generación de guías de 2024, que empezaban por los patrones y dejaban la conectividad como detalle de implementación — hoy la conectividad es la decisión que más condiciona todo lo demás.


Fuentes:

  • Gartner, proyección de adopción de agentes IA en apps empresariales 2025→2026
  • Anthropic — anuncio y roadmap del Model Context Protocol (MCP), 2024-2026
  • Linux Foundation — gobernanza abierta de MCP, 2026
  • ebankingnews.com — «Adopción de IA en 2026: Liderazgo Global y Avance de LatAm» (jul-2026)
  • ecosistemastartup.com — «IA empresarial 2026: 95% de empresas la adoptan» (abr-2026)
  • Universidad Siglo 21 / Duotach — «Top 5 Consultoras de IA en Argentina 2026» (jun-2026)
  • diegoceredi.com — «Agentes autónomos 2026: el mapa para empresas argentinas» (jun-2026)
  • Weaviate — ebook «Agentic Architectures for retrieval-intensive applications» (fundamentos y patrones)

Continue Reading

AI

Andrew Ng lanza OpenWorker, un agente de IA de código abierto

Publicado

on

Andrew Ng presentó OpenWorker, un agente de inteligencia artificial de código abierto que no se limita a chatear con el usuario, sino que entrega trabajo terminado: documentos redactados, mensajes de Slack enviados o eventos de calendario actualizados. El anuncio lo hizo el propio Ng junto a su socio Rohit Prasad, y la herramienta ya está disponible para descargar en Mac, con versión para Windows en camino.

El producto llega en un momento en que la carrera por los agentes de IA se acelera en todo el mundo, y Argentina no queda al margen de esa tendencia. OpenWorker funciona como una aplicación de escritorio construida con Tauri 2 y una interfaz en React, que se comunica con un servidor local en Python montado sobre FastAPI. A diferencia de otros asistentes que dependen de un servicio de inferencia propio, esta herramienta no tiene modelo propietario: el usuario debe traer su propia clave de API y elegir entre proveedores como OpenAI, Google o Anthropic, o bien optar por modelos de peso abierto como GLM, DeepSeek o Kimi, e incluso correr todo de forma local con Ollama para que los datos nunca salgan de la máquina.

El anuncio generó movimiento inmediato en el ecosistema de desarrolladores y en las redes de discusión tecnológica, donde OpenWorker fue comparado con otros agentes de escritorio que compiten por resolver tareas de oficina de punta a punta. El motor de la herramienta se apoya en aisuite, la biblioteca de enrutamiento de modelos que el propio Ng viene desarrollando, lo que le permite a las empresas alternar entre proveedores sin reescribir el código de sus flujos de trabajo. El repositorio publicado en GitHub suma más de 30 mil líneas de código en Python y una capa de permisos que clasifica cada acción del agente en cuatro niveles de riesgo, desde una simple lectura de archivos hasta una acción externa que requiere aprobación explícita del usuario antes de ejecutarse.

De cara a los próximos meses, el lanzamiento profundiza una discusión que ya venía instalada en la industria: si conviene depender de agentes cerrados y gestionados por una nube, o si el camino es hacia herramientas abiertas que corren en la computadora del usuario y solo se conectan a un proveedor de modelos cuando hace falta. No faltaron las voces críticas, que señalaron que aun con el código abierto, la dependencia de las claves de API de gigantes como OpenAI o Anthropic mantiene atada a la herramienta a esos mismos proveedores. Para los equipos de desarrollo y las empresas que evalúan sumar agentes a sus procesos, OpenWorker aparece como una alternativa concreta, gratuita y auditable, aunque con una barrera de entrada más alta que la de un asistente listo para usar: hay que instalar la aplicación, configurar las claves y, por ahora, contar con una computadora Mac.

Fuentes:

MarkTechPost: https://www.marktechpost.com/2026/07/23/andrew-ng-just-released-openworker-an-open-source-local-first-desktop-ai-coworker-that-returns-finished-deliverables-instead-of-chat/

Blockchain.News: https://blockchain.news/ainews/openworker-launches-open-source-agent-that-ships-work

Publicación de Andrew Ng en X: https://x.com/AndrewYNg/status/2080333504446108104

MoClaw Blog: https://moclaw.ai/blog/what-is-openworker

APIMart: https://apimart.ai/blog/openworker-andrew-ng-open-source-agents-deliver

Continue Reading

TENDENCIAS