¡Hola Devs! Se acabó la era del "agente de notebook"

Ya viviste esto: armas un agente con API de LLM + vector store + un router de tools + logs hechos a mano. Funciona en la demo. Truena el lunes en producción.

Microsoft Foundry acaba de lanzar una release que ataca justo eso. Tres cosas pasaron a GA al mismo tiempo:

  • Serie GPT-5.6 — Sol, Terra y Luna, modelos frontier de OpenAI, ahora nativos en Foundry.
  • Data Zone de Asia-Pacífico — residencia de datos regional, sin ambiente aparte que mantener.
  • Hosted agents en Foundry Agent Service — runtime de producción real, aceptando agentes hechos con cualquier framework.

Si estabas esperando una excusa para sacar el agente del Jupyter, es esta. (Fuente)

¿Sol, Terra o Luna? Cómo elegir

El nombre no es adorno — cada tier corresponde a un perfil de carga distinto.

ModeloMejor paraCosto relativo
GPT-5.6 SolRazonamiento extendido, loops agénticos, código pesadoMás alto
GPT-5.6 TerraApps empresariales del día a día, calidad GPT-5.5 más barataMedio
GPT-5.6 LunaAlto volumen, sensible a latenciaMás bajo

Precio por millón de tokens (Standard Global, contexto corto):

  • Sol — US$ 5.00 input / US$ 0.50 cache / US$ 30.00 output
  • Terra — US$ 2.00 input / US$ 0.20 cache / US$ 12.00 output
  • Luna — US$ 0.20 input / US$ 0.02 cache / US$ 1.20 output

La diferencia entre Sol y Luna es de 25x en input. Eso no es un detalle — es una decisión de arquitectura. Rutea agresivo.

Developer comparing GPT-5.6 Sol Terra Luna model tiers on Microsoft Foundry dashboard for agent workloads Development Concept Image

Hosted Agents: un runtime, cualquier framework

Lo fuerte de esta release es que Foundry Agent Service ahora corre agentes hechos con Microsoft Agent Framework, GitHub Copilot SDK, LangGraph, OpenClaw, Hermes y más — todo en el mismo runtime de producción.

Lo que traes de cajón:

  • Aislamiento de red vía Azure VNet — el tráfico del agente se queda dentro de tu perímetro.
  • Resilient task support (preview privada) — checkpointing + primitivas de la plataforma hacen que el agente retome tras un restart. Ya no armes retry/state machine a mano.
  • Voice Live en GA — voz en tiempo real vía Azure VoiceLive SDK, sobre el agente que ya tienes.
  • Toolboxes en GA — en lugar de mandar todas las definiciones de tools en cada request, la toolbox elige la tool correcta por llamada. Ahorro brutal de tokens.
  • Foundry IQ en GA — capa de conocimiento con SLA que une Work IQ (M365), Fabric IQ (datos estructurados) y Web IQ (grounding web en vivo).

Un deploy mínimo se ve así:

# Deploy de un hosted agent en Foundry Agent Service
from azure.ai.foundry import AgentClient, HostedAgentSpec

client = AgentClient(endpoint="https://<tu-foundry>.azure.com")

spec = HostedAgentSpec(
    name="triaje-soporte",
    model="gpt-5.6-terra",   # balance costo/calidad para triaje
    framework="langgraph",   # o microsoft-agent-framework, copilot-sdk, ...
    tools=["toolbox:ticket-tools"],  # toolbox resuelve tools por request
    memory="session",        # procedural / user / session
)

client.deploy(spec)

Memoria y routines están en preview pública — routines dejan que el agente dispare por horario o por evento upstream (ticket abierto, archivo llegó al storage, workflow completado) vía connector gateway.

Cloud architect diagramming APAC Data Zone deployment for frontier OpenAI models inside Microsoft Foundry Algorithm Concept Visual

La parte de gobernanza es donde se pone bueno

Casi toda plataforma de agentes se detiene en "ya corre". El pitch de Foundry es responder tres preguntas incómodas:

  1. ¿Qué hizo el agente? — Tracing y evaluation para hosted agents en GA. Ves el camino de la decisión, no solo la salida.
  2. ¿Está mejorando y abaratándose? — Agent optimizer (preview pública) ajusta prompts, skills, tools y elección de modelo juntos. Muchas veces mantienes calidad migrando a un modelo más barato.
  3. ¿Vale la pena correrlo? — ROI for agents (preview privada) junta traces, evals de valor de negocio y costo operativo en un dashboard: net value, costo total, ROI actual.

Dónde están las grietas

Antes de apostarlo todo, checa esto:

  • Preview ≠ producción. Memoria, routines, resilient tasks, agent optimizer y ROI están en preview. No construyas compliance encima todavía.
  • Toolbox es caja negra. La selección dinámica ahorra tokens, pero pierdes inspección estática. Reserva tiempo para tracing cuando debuggees tool-calls.
  • La matemática de precio es agresiva. El gap Sol/Luna hace que arquitectura (ruteo, cache, batch) importe más que tuning de prompt.
  • Gravedad de proveedor. Publicar en Teams/M365 Copilot es cómodo — y también significa que tu capa de distribución es de Microsoft.

Siguientes pasos

Si quieres entender cómo medir si todo esto sirve, la disciplina de evals no es opcional — checa por qué LLM evals y tests A/B son embudos distintos, no bifurcaciones. Y si te late el patrón de fundaciones absorbiendo ecosistemas, el movimiento de React Foundation a Linux Foundation es el mismo playbook en otra arena.

Production agent runtime dashboard showing hosted agents tracing and ROI metrics in Foundry Agent Service Developer Related Image

En resumen, Dev

La release de Foundry es menos sobre una feature específica y más sobre la forma de la plataforma: un runtime, cualquier framework, gobernanza real, distribución real. Es un cambio fuerte respecto a la era de "ármate tu stack de agente a mano".

Los equipos que están entregando más rápido (Adobe, Telefónica, TCS) no están ganando por prompt ingenioso — están ganando porque dejaron de integrar y empezaron a deployar.

Empieza con el Quickstart, usa Terra como default, y solo sube a Sol cuando la carga de verdad lo exija. Rutea, cachea y mide — o la cuenta de tokens te va a rutear a ti.

Este contenido fue redactado con la asistencia de herramientas de IA, basándose en fuentes confiables, y fue revisado por nuestro equipo editorial antes de su publicación. No reemplaza el asesoramiento de un profesional especializado.