Microsoft propone medir “useful yield”: cuánta inteligencia útil obtenés por dólar y watt, no solo cuánta capacidad instalás.
Su enfoque cruza silicio, memoria, red, energía, software y modelos.
Para un agente, la métrica cambia: tokens/$, tokens/W, throughput y latencia por tarea.
Es una tesis de infraestructura, no un benchmark independiente.
Qualcomm y ASUS anunciaron un agente farmacéutico que corre localmente, incluso offline.
Optimizaron GPT-OSS de 120B a 20B para un AI PC, integraron prospectos abiertos de la autoridad sanitaria taiwanesa y lo llevarán a más de 50 farmacias demostrativas.
Es anuncio del proveedor: la prueba real será medir errores, latencia y revisión humana antes de usarlo en salud.
GitHub publicó cómo hacer más eficientes los agentes de coding sin degradar la tarea completa.
En Copilot, quitar prefijos de línea redujo ~3% el costo diario de inferencia por usuario en una prueba online, sin regresión material en calidad. También comprimen ruido y eliminan turnos de recuperación.
La métrica correcta: costo y latencia por tarea completa, no por tool call.
Meta acaba de lanzar Muse Spark 1.3.
El salto que destaca Zuckerberg está en coding y trabajo agéntico: lo presenta como su mayor avance hasta ahora y ya se puede probar en Muse Code y la API.
La forma útil de medirlo: misma tarea, mismo repo y mismo límite; compará éxito, turnos, tokens, latencia y costo.
¿Lo probarías primero como coding agent o para automatizar flujos largos?
SteamDB no anunció una feature: anunció un plan de continuidad. Después de 13 años, su creador se suma a Nexus Mods porque mantener el servicio ya era un trabajo de tiempo completo y el burnout lo hacía insostenible en solitario. La promesa es que SteamDB siga siendo SteamDB, pero con más recursos, capacidad de desarrollo y estabilidad. Para cualquier API, bot o herramienta open source, el checklist real incluye maintainer de backup, documentación operativa, backups verificables y un plan de costos. ¿Qué parte de tu proyecto depende hoy de una sola persona?
Google habilitó Agentic Video Understanding en Gemini 3.7 Flash, 3.6 Flash y 3.5 Flash-Lite. En vez de procesar todo a una tasa fija, el modelo busca, escanea y vuelve a mirar los tramos útiles combinando frames, audio y transcripción. Google reporta hasta 88% menos tokens, 66% menos costo y 7% más precisión en sus benchmarks. Se activa en la API con procesamiento agentic. Para un MVP: probalo sobre una clase o keynote de 60 minutos y medí tokens, latencia y recall. ¿Qué video largo analizarías primero?
Google lanzó Gemini 3.8 Flash y Gemini 3.8 Flash Cyber. El primero apunta a coding, agentes y razonamiento multi-paso; el segundo, a detectar y parchear vulnerabilidades para defensores confiables. La parte que importa para developers: 3.8 Flash usa loops agentic largos y puede gastar más tokens en tareas complejas, aunque mantiene el precio introductorio de 3.7 Flash. Más capacidad no siempre significa menor costo: hay que medir calidad, latencia y tokens por tarea. ¿Lo probarías en coding, agentes o revisión de seguridad?
Microsoft está tratando la seguridad de agentes como un ciclo de ingeniería:
• red team automatizado para encontrar riesgos
• evaluadores como tests de sistema y de proceso
• permisos, identidad y monitoreo durante la ejecución
La idea importante: no alcanza con revisar la respuesta final. También hay que medir qué herramientas eligió, qué parámetros envió y si respetó las reglas.
Varias funciones están en preview. Aun así, el patrón ya es claro: evaluar agentes como software.