¡Hola Devs! Se acabó la era del "agente de notebook"
Ya viviste esto: armas un agente con API de LLM + vector store + un router de tools + logs hechos a mano. Funciona en la demo. Truena el lunes en producción.
Microsoft Foundry acaba de lanzar una release que ataca justo eso. Tres cosas pasaron a GA al mismo tiempo:
- Serie GPT-5.6 — Sol, Terra y Luna, modelos frontier de OpenAI, ahora nativos en Foundry.
- Data Zone de Asia-Pacífico — residencia de datos regional, sin ambiente aparte que mantener.
- Hosted agents en Foundry Agent Service — runtime de producción real, aceptando agentes hechos con cualquier framework.
Si estabas esperando una excusa para sacar el agente del Jupyter, es esta. (Fuente)
¿Sol, Terra o Luna? Cómo elegir
El nombre no es adorno — cada tier corresponde a un perfil de carga distinto.
| Modelo | Mejor para | Costo relativo |
|---|---|---|
| GPT-5.6 Sol | Razonamiento extendido, loops agénticos, código pesado | Más alto |
| GPT-5.6 Terra | Apps empresariales del día a día, calidad GPT-5.5 más barata | Medio |
| GPT-5.6 Luna | Alto volumen, sensible a latencia | Más bajo |
Precio por millón de tokens (Standard Global, contexto corto):
- Sol — US$ 5.00 input / US$ 0.50 cache / US$ 30.00 output
- Terra — US$ 2.00 input / US$ 0.20 cache / US$ 12.00 output
- Luna — US$ 0.20 input / US$ 0.02 cache / US$ 1.20 output
La diferencia entre Sol y Luna es de 25x en input. Eso no es un detalle — es una decisión de arquitectura. Rutea agresivo.

Hosted Agents: un runtime, cualquier framework
Lo fuerte de esta release es que Foundry Agent Service ahora corre agentes hechos con Microsoft Agent Framework, GitHub Copilot SDK, LangGraph, OpenClaw, Hermes y más — todo en el mismo runtime de producción.
Lo que traes de cajón:
- Aislamiento de red vía Azure VNet — el tráfico del agente se queda dentro de tu perímetro.
- Resilient task support (preview privada) — checkpointing + primitivas de la plataforma hacen que el agente retome tras un restart. Ya no armes retry/state machine a mano.
- Voice Live en GA — voz en tiempo real vía Azure VoiceLive SDK, sobre el agente que ya tienes.
- Toolboxes en GA — en lugar de mandar todas las definiciones de tools en cada request, la toolbox elige la tool correcta por llamada. Ahorro brutal de tokens.
- Foundry IQ en GA — capa de conocimiento con SLA que une Work IQ (M365), Fabric IQ (datos estructurados) y Web IQ (grounding web en vivo).
Un deploy mínimo se ve así:
# Deploy de un hosted agent en Foundry Agent Service
from azure.ai.foundry import AgentClient, HostedAgentSpec
client = AgentClient(endpoint="https://<tu-foundry>.azure.com")
spec = HostedAgentSpec(
name="triaje-soporte",
model="gpt-5.6-terra", # balance costo/calidad para triaje
framework="langgraph", # o microsoft-agent-framework, copilot-sdk, ...
tools=["toolbox:ticket-tools"], # toolbox resuelve tools por request
memory="session", # procedural / user / session
)
client.deploy(spec)
Memoria y routines están en preview pública — routines dejan que el agente dispare por horario o por evento upstream (ticket abierto, archivo llegó al storage, workflow completado) vía connector gateway.

La parte de gobernanza es donde se pone bueno
Casi toda plataforma de agentes se detiene en "ya corre". El pitch de Foundry es responder tres preguntas incómodas:
- ¿Qué hizo el agente? — Tracing y evaluation para hosted agents en GA. Ves el camino de la decisión, no solo la salida.
- ¿Está mejorando y abaratándose? — Agent optimizer (preview pública) ajusta prompts, skills, tools y elección de modelo juntos. Muchas veces mantienes calidad migrando a un modelo más barato.
- ¿Vale la pena correrlo? — ROI for agents (preview privada) junta traces, evals de valor de negocio y costo operativo en un dashboard: net value, costo total, ROI actual.
Dónde están las grietas
Antes de apostarlo todo, checa esto:
- Preview ≠ producción. Memoria, routines, resilient tasks, agent optimizer y ROI están en preview. No construyas compliance encima todavía.
- Toolbox es caja negra. La selección dinámica ahorra tokens, pero pierdes inspección estática. Reserva tiempo para tracing cuando debuggees tool-calls.
- La matemática de precio es agresiva. El gap Sol/Luna hace que arquitectura (ruteo, cache, batch) importe más que tuning de prompt.
- Gravedad de proveedor. Publicar en Teams/M365 Copilot es cómodo — y también significa que tu capa de distribución es de Microsoft.
Siguientes pasos
Si quieres entender cómo medir si todo esto sirve, la disciplina de evals no es opcional — checa por qué LLM evals y tests A/B son embudos distintos, no bifurcaciones. Y si te late el patrón de fundaciones absorbiendo ecosistemas, el movimiento de React Foundation a Linux Foundation es el mismo playbook en otra arena.

En resumen, Dev
La release de Foundry es menos sobre una feature específica y más sobre la forma de la plataforma: un runtime, cualquier framework, gobernanza real, distribución real. Es un cambio fuerte respecto a la era de "ármate tu stack de agente a mano".
Los equipos que están entregando más rápido (Adobe, Telefónica, TCS) no están ganando por prompt ingenioso — están ganando porque dejaron de integrar y empezaron a deployar.
Empieza con el Quickstart, usa Terra como default, y solo sube a Sol cuando la carga de verdad lo exija. Rutea, cachea y mide — o la cuenta de tokens te va a rutear a ti.