Tutoriales, comparativas y patrones de diseño para construir agentes autónomos que se autofinancian, llaman a 345+ modelos y orquestan MCP Tools.
Una llamada LLM es output medido: solo sabes lo que costó después del último token. Este es el tour interno del patrón de facturación que hace funcionar un balance prepago de todos modos — reservar el peor caso antes de que salga el request, hacer proxy del stream sin tocarlo, settlear el costo real desde el chunk final de usage, reembolsar el delta. Más la razón por la que max_tokens es tu perilla de reserva, por qué las respuestas en streaming reportan el costo en el último evento SSE en vez de un header, cómo la misma reserva se convierte en la cotización x402 walk-up, y los tres edge cases que deciden si un diseño de facturación es honesto: streams caídos, fallbacks a mitad de chain y rate limits upstream.
La mayoría de los usuarios del API de LLM4Agents nunca se entera de que el MCP server en mcp.llm4agents.com expone 67 tools documentadas en doce familias: scraping headless con tiers de proxy y sesiones persistentes, búsqueda de Google en batches de 100, generación y análisis de imágenes, ocho primitivas de Workers AI, un workspace de archivos sobre R2 con tokens de descarga de un solo uso, un vector store de 768 dimensiones, memoria key-value, notificaciones con webhook protegido contra SSRF, once utilidades de datos, lecturas web3 read-only en cuatro chains y parsing de documentos. Cada tool paga responde a una Bearer key contra tu balance, y casi todas responden también a un pago firmado x402 con 10 por ciento de descuento — hacemos curl al endpoint sin credenciales y decodificamos la cotización HTTP 402 en vivo para mostrar exactamente cómo. Más los anchors de pricing, las tres excepciones balance-only, cuándo pasar de scrapes one-shot a sesiones, y la disciplina de allowlist que evita que 67 tools se conviertan en 67 superficies de ataque.
La mayoría de los sistemas de memoria de agentes le pagan a un LLM para leer el transcript y extraer creencias en cada interacción. FERNme — Fuzzy-Edged Recall Network — hace lo contrario: actualizaciones Hebbianas deterministas sobre un grafo de edges difusos 0–9, cero llamadas a LLM en el path de escritura, y una card de prompt que se mantiene cerca de 25 tokens sea tu primera visita o tu quinto año. Trae una superficie REST en FastAPI, un MCP server, un editor glass-box, y un diseño de supernode que deja a un usuario ensamblar un perfil cross-site que él controla, default-deny. Recorremos la mecánica, los benchmarks reportados (detección de drift 0.72 vs 0.13, cards 77× más chicas, escrituras 122× más baratas que Mem0 en modo pure), los caveats honestos de un research preview v0.3 sobre data sintética, y qué significa una capa de memoria determinista, resistente a inyección y user-owned para un gateway de pagos de agentes que factura por llamada.
La semana en que la economía de agentes dejó de ser un demo. Mastercard lanzó Agent Pay for Machines el 10 de junio con 30+ partners y USDC/RLUSD como riel de settlement core. Coinbase y AWS metieron x402 en CloudFront y WAF el 16 de junio, poniendo HTTP 402 en el edge de infraestructura. El working group de MCP cerró un release candidate stateless antes del final del 28 de julio. Y la estantería frontier volvió a rotar: Fable 5 fue retirado de disponibilidad general, GPT-5.6 se filtró, y Gemini 3.5 Pro se acercó a GA. Leemos cada cosa con un lente: qué significa para un gateway compatible con OpenAI donde los agentes pagan por llamada en stablecoins.
Agent Builder y Evals de OpenAI quedan en read-only el 31 de octubre de 2026, y cierran el 30 de noviembre. Todo operador construido sobre esos productos tiene una ventana de migración de seis meses. Este post es el runbook: un mapeo de seis piezas desde OpenAI Agent Builder al stack de LLM4Agents, con código real en ambos lados. Cubrimos el system prompt y el loop de conversación usando la API client.chat.conversation del SDK @llm4agents/sdk, el catálogo de herramientas usando el MCP server unificado en mcp.llm4agents.com (70+ tools en las categorías scraper, search, image, AI, notify, data, vector, workspace, web3, document), la base de conocimiento usando workspace_upload más vector_upsert y vector_query, la suite de eval usando Promptfoo apuntado al endpoint OpenAI-compatible /v1/chat/completions, la memoria de conversación usando memory_set y memory_get para estado cross-session más el campo history para estado intra-session, y el shell de deployment usando agent-playground o el CLI agent-helper mientras la UI de Agent Builder de LLM4Agents todavía está en desarrollo. También explicamos qué te dan los model fallback chains, el modelo de billing reserve-proxy-settle, y los headers X-Cost-Usd-Cents que OpenAI no daba. El post va apareado con el resumen del viernes que reportó el sunset; el operador que lee los dos tiene el por qué y el cómo.
Producción con un solo modelo es frágil. Un rate limit en el tier primario se convierte en un fallo cara al cliente para un operador solo que construyó el agente sobre un único model id. Las cadenas de fallback de modelo son la feature del proxy de LLM4Agents que resuelve esto sin sumarte código: pasa models: [a, b, c] en lugar de model: a, y el proxy reserva al tier más caro de la cadena, intenta cada modelo en orden ante overflow de context-length, rate-limit, error de proveedor o rechazo de moderación, y settla al modelo real que respondió, devuelto en el header de respuesta X-Model-Used. El post recorre qué hace la cadena del lado del server, la interacción reserve-proxy-settle que la hace segura, los tres headers de respuesta que los operadores tienen que loguear para detectar fallback silencioso en producción, tres cadenas canónicas para workloads price-optimized, latency-optimized y sovereignty-optimized, cómo cablear cobertura de eval que pruebe cada eslabón individualmente con Promptfoo, la economía real del overhead de reserva versus la tasa de falla que la cadena absorbe, y cuatro anti-patrones que convierten una cadena de una compra de confiabilidad en un pasivo. El post va apareado con el post de migración; si portaste tu agente desde OpenAI Agent Builder el fin de semana pasado, las cadenas de fallback son la primera feature de plataforma que no existía en el stack anterior.
Una semana cargada. Anthropic lanzó Claude Fable 5 a $10/$50 por millón de tokens con nuevas clases de rechazo para ciberseguridad, biología y destilación que los operadores van a chocar de manera desigual. MetaMask abrió early access para Agent Wallet con límites de gasto por defecto y seguro de Blockaid hasta $10K, la primera wallet mainstream que lanza custodia nativa para agentes. OpenAI anunció que Agent Builder y Evals quedan en read-only el 31 de octubre y cierran el 30 de noviembre, forzando una migración con ventana de seis meses a todos los operadores construidos sobre la plataforma. La Comisión Europea designó sesenta expertos independientes al Panel Científico y al Foro Asesor del AI Act, dejando la estructura concreta de enforcement antes del deadline del 2 de agosto. Unit 42 de Palo Alto publicó tres nuevos vectores de ataque MCP basados en el primitivo de Sampling — robo de recursos, secuestro de conversación, invocación encubierta de herramientas — que los operadores que corren MCP servers de terceros tienen que mapear contra su threat model esta semana, no el próximo trimestre.
Después de veintitrés posts largos sobre protocolos, evaluación, seguridad, compliance, nichos y proyecciones, el seguimiento honesto es un post corto. La lectura está haciendo menos trabajo del que pensás, y el agente que vive solo como una pestaña en tu navegador no se va a hacer real por sí solo. Este texto argumenta por lanzar antes que investigar: cinco cosas chicas que realmente necesitás antes del lunes, tres cosas grandes que no, y la versión del primer agente que toma una tarde de lunes para dejar viva. Sin teoría nueva. Sin framework nuevo. El empujón mínimo para que el operador que viene leyendo esta serie hace meses entre en la parte del trabajo donde el progreso compone.