Cayodis

How AI-native companies turn workflows into operating capability

openai.com ·
How AI-native companies turn workflows into operating capability

OpenAI muestra tres patrones para operar con agentes: convertir procesos estables en skills reusables, mantener contexto persistente por cuenta y conectar una señal con un artefacto probado mediante pull requests, tests y revisión humana. La métrica útil no es cuántos tokens consume el agente, sino si termina la tarea con menos tiempo, costo y excepciones sin aumentar la carga de control.

The New Imperative for AI Infrastructure: Useful Yield - Source Asia

news.microsoft.com ·
The New Imperative for AI Infrastructure: Useful Yield - Source Asia

Microsoft propone medir “useful yield”: cuánta inteligencia útil obtenés por dólar y watt, no solo cuánta capacidad instalás. Su enfoque cruza silicio, memoria, red, energía, software y modelos. Para un agente, la métrica cambia: tokens/$, tokens/W, throughput y latencia por tarea. Es una tesis de infraestructura, no un benchmark independiente.

Qualcomm & ASUS Launch Pharmacy AI Agent for Drug Safety

press.asus.com ·
Qualcomm & ASUS Launch Pharmacy AI Agent for Drug Safety

Qualcomm y ASUS anunciaron un agente farmacéutico que corre localmente, incluso offline. Optimizaron GPT-OSS de 120B a 20B para un AI PC, integraron prospectos abiertos de la autoridad sanitaria taiwanesa y lo llevarán a más de 50 farmacias demostrativas. Es anuncio del proveedor: la prueba real será medir errores, latencia y revisión humana antes de usarlo en salud.

How we make AI coding more cost efficient without sacrificing task quality

github.blog ·
How we make AI coding more cost efficient without sacrificing task quality

GitHub publicó cómo hacer más eficientes los agentes de coding sin degradar la tarea completa. En Copilot, quitar prefijos de línea redujo ~3% el costo diario de inferencia por usuario en una prueba online, sin regresión material en calidad. También comprimen ruido y eliminan turnos de recuperación. La métrica correcta: costo y latencia por tarea completa, no por tool call.

Mark Zuckerberg (@finkd) on X

x.com ·
Mark Zuckerberg (@finkd) on X

Meta acaba de lanzar Muse Spark 1.3. El salto que destaca Zuckerberg está en coding y trabajo agéntico: lo presenta como su mayor avance hasta ahora y ya se puede probar en Muse Code y la API. La forma útil de medirlo: misma tarea, mismo repo y mismo límite; compará éxito, turnos, tokens, latencia y costo. ¿Lo probarías primero como coding agent o para automatizar flujos largos?

SteamDB Joins Nexus Mods

steamdb.info ·
SteamDB Joins Nexus Mods

SteamDB no anunció una feature: anunció un plan de continuidad. Después de 13 años, su creador se suma a Nexus Mods porque mantener el servicio ya era un trabajo de tiempo completo y el burnout lo hacía insostenible en solitario. La promesa es que SteamDB siga siendo SteamDB, pero con más recursos, capacidad de desarrollo y estabilidad. Para cualquier API, bot o herramienta open source, el checklist real incluye maintainer de backup, documentación operativa, backups verificables y un plan de costos. ¿Qué parte de tu proyecto depende hoy de una sola persona?

Introducing agentic video understanding with Gemini

blog.google ·
Introducing agentic video understanding with Gemini

Google habilitó Agentic Video Understanding en Gemini 3.7 Flash, 3.6 Flash y 3.5 Flash-Lite. En vez de procesar todo a una tasa fija, el modelo busca, escanea y vuelve a mirar los tramos útiles combinando frames, audio y transcripción. Google reporta hasta 88% menos tokens, 66% menos costo y 7% más precisión en sus benchmarks. Se activa en la API con procesamiento agentic. Para un MVP: probalo sobre una clase o keynote de 60 minutos y medí tokens, latencia y recall. ¿Qué video largo analizarías primero?

Introducing Gemini 3.8 Flash and 3.8 Flash Cyber

blog.google ·
Introducing Gemini 3.8 Flash and 3.8 Flash Cyber

Google lanzó Gemini 3.8 Flash y Gemini 3.8 Flash Cyber. El primero apunta a coding, agentes y razonamiento multi-paso; el segundo, a detectar y parchear vulnerabilidades para defensores confiables. La parte que importa para developers: 3.8 Flash usa loops agentic largos y puede gastar más tokens en tareas complejas, aunque mantiene el precio introductorio de 3.7 Flash. Más capacidad no siempre significa menor costo: hay que medir calidad, latencia y tokens por tarea. ¿Lo probarías en coding, agentes o revisión de seguridad?