← Ver edición actual
Briefing Semanal 29 junio — 5 julio 2026

Un modelo chino de escala frontera se entrena sin un solo chip de Nvidia, los agentes estrenan su primer ransomware autónomo y un panel de la ONU concluye que nadie puede garantizar que la IA no cause un daño catastrófico: la semana en que la IA salió de la demo y chocó con la producción.

10 historias 9 fuentes 20 min. de lectura
Resumen de la semana

Meituan liberó LongCat-2.0, un MoE de 1,6 billones de parámetros con licencia MIT que dice haberse entrenado de punta a punta sin un solo chip de Nvidia, sobre unos 50.000 aceleradores chinos —aunque los pesos completos aún no aparecen y los números son suyos.

Anthropic abarató los agentes con Claude Sonnet 5, casi tan capaz como Opus 4.8 pero mucho más barato, y Mistral abrió Leanstral 1.5, cuyas pruebas verifica un compilador y no otro modelo.

Los agentes chocaron con la producción: un paper le puso nombre por primera vez a los 'bucles infinitos' que disparan el costo en agentes desplegados, y otro halló que subir el esfuerzo de razonamiento —no agregar herramientas— es lo que los vuelve confiables.

En seguridad, Sysdig documentó el primer ransomware operado de principio a fin por un agente de IA autónomo, aunque el propio agente perdió la clave y dejó los datos irrecuperables.

Y el primer panel científico de la ONU, copresidido por Bengio y Ressa, sentenció que la ciencia hoy no puede garantizar que la IA no cause un daño catastrófico, justo cuando otro banco de pruebas mostró que los mejores modelos resuelven menos de un tercio de problemas reales de biología.

01 / 10
VentureBeat30 junio 2026

Meituan libera LongCat-2.0, un modelo de escala frontera entrenado sin chips de Nvidia

Meituan publicó el 30 de junio LongCat-2.0, un MoE de 1,6 billones de parámetros totales —unos 33.000 a 56.000 millones activos por token— con licencia MIT, y reveló que era 'Owl Alpha', el modelo anónimo que llevaba dos meses encabezando OpenRouter. La afirmación de fondo es la que pesa: dice haberse entrenado de principio a fin sobre unos 50.000 aceleradores chinos, sin una sola GPU de Nvidia, algo que ningún modelo chino de tope había logrado antes en la fase de preentrenamiento. El caveat no es menor: los pesos completos aún figuran como 'próximamente' y los 59,5 puntos de SWE-bench Pro que lo ponen por encima de GPT-5.5 salen de pruebas de la propia empresa, sin verificación independiente.

Leer en VentureBeat
modelosopen-sourcechina
02 — 10
02

Anthropic lanza Claude Sonnet 5: casi el nivel de Opus 4.8 a precio de agente

Anthropic presentó el 30 de junio Claude Sonnet 5 como su modelo de gama media más orientado a agentes, ya por defecto en los planes Free y Pro, en la API y en Claude Code. Lo vende con un argumento directo: rinde cerca de Opus 4.8 pero a un precio bastante menor, dos y diez dólares por millón de tokens de entrada y salida en su tarifa de estreno. Trae además un tokenizador nuevo que puede mapear el mismo texto a más tokens, de 1 a 1,35 veces según el contenido, un matiz que conviene tener en cuenta al calcular el costo real.

2 min
03

El primer estudio que le pone nombre a los 'bucles infinitos' de los agentes en producción

Un equipo analizó 6.549 repositorios de agentes LLM y aisló una clase de falla que bautizó 'bucles agénticos infinitos' (IAL): el agente repite llamadas al modelo, a herramientas o traspasos entre agentes cuando el camino de retroalimentación no tiene un tope efectivo. No son bucles de programación comunes, sino un patrón que dispara costos, denegación de servicio y efectos colaterales repetidos, y hasta ahora nadie lo había caracterizado de forma sistemática. Los autores publicaron además IAL-Scan, un analizador estático que detecta el problema en proyectos reales.

2 min
04

Más razonamiento, no más herramientas: qué vuelve confiable a un agente de código

Un estudio observacional puso a noventa agentes a construir la misma aplicación desde una sola especificación y midió qué influía realmente en la confiabilidad. El hallazgo va contra la intuición dominante: subir el esfuerzo de razonamiento de 'alto' a 'muy alto' llevó los aciertos perfectos al primer intento del 28% al 89%, mientras que sumar una herramienta de pruebas encareció la corrida entre un 42% y un 68% sin mejorar el resultado. Sugiere que buena parte de la industria está invirtiendo ingeniería de andamiaje en el lugar equivocado del stack.

2 min
05

Sysdig documenta el primer ransomware operado de punta a punta por un agente de IA

El equipo de amenazas de Sysdig identificó a 'JADEPUFFER', que describe como el primer caso documentado de un ataque de ransomware conducido de principio a fin por un agente LLM autónomo: entró por una vieja falla sin parchar en Langflow, se autocorrigió en 31 segundos y cifró 1.342 configuraciones de una base de datos de producción. La prueba de su autonomía está en el propio código, que va narrando su razonamiento en lenguaje natural a lo largo de más de 600 acciones encadenadas sin humano en el bucle. Lo irónico: el agente perdió la clave de cifrado y volvió los datos irrecuperables, y la dirección de Bitcoin del rescate era un ejemplo sacado de la documentación, casi con seguridad un rastro de su entrenamiento.

2 min
06

El primer panel científico de la ONU sobre IA: la ciencia no puede garantizar que no cause un daño catastrófico

El Panel Científico Internacional Independiente sobre IA de la ONU, copresidido por Yoshua Bengio y la Nobel Maria Ressa con cuarenta expertos de las cinco regiones, publicó el 1 de julio su informe preliminar. Su conclusión central, redactada en un lenguaje deliberadamente sobrio por el consenso de esos cuarenta científicos: la ciencia hoy no puede garantizar que una IA cada vez más capaz no cause un daño catastrófico, por sí sola o en manos malintencionadas. El informe también liga la adulación estructural de los modelos con muertes documentadas y recuerda que Estados Unidos concentra el 75% del cómputo de frontera y China el 15%.

2 min
07

Nvidia y Valar Atomics encienden el primer centro de datos de IA alimentado por un reactor nuclear

El 1 de julio, la startup nuclear Valar Atomics y Nvidia conectaron en Orangeville (Utah) su reactor Ward250 —crítico desde el 18 de junio— a un chip Blackwell, la primera vez que un reactor pequeño alimenta directamente cómputo de IA sin pasar por la red eléctrica. El plan es un centro de datos de 30 megavatios refrigerado con helio, prácticamente sin consumo de agua, unas trescientas veces más chico que un campus típico. Por ahora es una demostración —el reactor genera apenas 100 kilovatios y falta la licencia regulatoria—, pero apunta a cómo aliviar el cuello de botella energético que hoy frena el despliegue de GPUs.

2 min
08

GeneBench-Pro: los mejores modelos resuelven menos de un tercio de los problemas reales de biología

OpenAI publicó el 30 de junio GeneBench-Pro, un banco de 129 problemas de investigación en genómica y medicina traslacional generados de forma sintética a partir de una estructura causal conocida, lo que permite calificarlos de forma determinista contra la respuesta correcta. Los resultados humillan al estado del arte: el mejor modelo resuelve el 31,5% y Claude Opus 4.8 apenas el 16%, en tareas que a un experto le llevarían de veinte a cuarenta horas. Lo que mide no es recordar datos sino el criterio de investigación —qué pregunta soporta un conjunto de datos ruidoso—, y OpenAI liberó diez tareas en Hugging Face para verificación independiente.

2 min
09

Microsoft mide en decenas de miles de ingenieros el efecto real de los agentes de código

Investigadores de Microsoft siguieron por unos cuatro meses a decenas de miles de sus ingenieros durante el despliegue temprano de Claude Code y GitHub Copilot CLI, con telemetría por persona en vez de encuestas. Hallaron que la adopción se propagó por las redes sociales internas, que la retención depende más del hábito de programar que de la demografía y que quienes los adoptaron integraron alrededor de un 24% más de pull requests, un empujón que se sostuvo en el tiempo. Es un contraste con estudios previos sobre Cursor, cuyo efecto se desvanecía al tercer mes.

2 min
10

Leanstral 1.5: un modelo abierto que prueba teoremas en Lean 4 y caza bugs reales

Mistral publicó el 3 de julio Leanstral 1.5 —un MoE de 119.000 millones de parámetros, 6.500 millones activos, con licencia Apache 2.0— especializado en demostración formal: satura miniF2F y resuelve 587 de 672 problemas de PutnamBench. Su gracia está en cómo se comprueba: sus pruebas las valida un compilador de Lean, no el juicio de otro modelo, y supera a Opus 4.6 en el banco FLTEval a un séptimo del costo. Usado como agente sobre repositorios reales, halló once fallos genuinos —cinco de ellos desconocidos— razonando de forma matemática, un cruce insólito entre demostradores y programación agéntica.

2 min

Herramientas que uso

Afiliado

Fathom

Asistente de IA que graba, transcribe y resume tus reuniones (Zoom, Meet, Teams). Lo uso a diario. Si te suscribes desde este link, recibo créditos que sostienen PX Noticias IA.

Conocer Fathom →
Recomendación

OpenWhispr

Dictado por voz open source que corre 100% local (Whisper/Parakeet): tu audio nunca sale de tu máquina. Privacidad primero, gratis y multiplataforma.

Visitar OpenWhispr →

Quién hace esto

Jonathan Proaño

Soy Jonathan. Construyo sitios web, apps e implementaciones de IA en Parlox Network.

Si tú o tu organización necesitan asesoría, desarrollo o un copiloto con criterio para sus proyectos de software o IA — escríbeme directo. Respondo personalmente todos los mensajes.

Sobre el sitio

PX Noticias IA es un briefing semanal curado de noticias sobre inteligencia artificial, escrito en español. Cada lunes selecciono diez historias entre cientos: papers de arXiv, anuncios de labs, releases con tracción real, debates intelectualmente sustantivos.

No es un agregador. Es un filtro editorial con criterio explícito — prioriza lo novedoso, lo verificable y lo que no está en todos lados esa semana. Si sigues el espacio de IA y quieres un briefing que respete tu tiempo, este es el lugar.