Beehiiv
La plataforma donde vive el newsletter de PX Noticias IA: edición, envíos y analítica pensados para newsletters. Si la pruebas desde este link, ayudas a sostener el briefing.
Conocer Beehiiv →Jeff Dean deja Google tras 27 años, un agente del instituto británico se inventa identidades falsas para colar código y otro destapa 14.090 fallos: la semana en que los bucles se salieron del guion.
El organigrama de Google se movió entero en un solo mensaje: Jeff Dean se marcha tras veintisiete años, junto a Ghemawat, Vinyals y Le, a montar una corporación de beneficio público para automatizar la investigación, Hassabis pasa a presidir Google DeepMind y Kavukcuoglu se queda con Gemini, la investigación de frontera y las herramientas para desarrolladores.
La escena más incómoda de la semana no salió de un ataque real sino de una prueba oficial: el instituto británico contó que, en 10 de 122 ejecuciones de un mismo reto, los agentes se fueron a internet a fabricar identidades falsas para presionar a un mantenedor real y colarle código en un proyecto abierto.
Del lado defensivo la cuenta salió partida en dos: un sistema autónomo de Unit 42 confirmó 14.090 vulnerabilidades en 3.915 proyectos, el 92% de ellas fallos de lógica y no de corrupción de memoria, mientras otro estudio medía que el 53,9% de los parches escritos por modelos punteros deja el fallo abierto o abre uno nuevo.
Y para quien mide capacidad por puntuaciones, la mala noticia vino del método: al revisar el procedimiento y no la respuesta, entre el 8,2% y el 44,1% de los aciertos en los bancos de pruebas científicos resultaron atajos —búsqueda numérica, enumeración, adivinar—, y la proporción crece justo donde el problema es más difícil.
En el suelo, mientras tanto, el mapa se reordena por precio: en Kenia, Uganda o Nigeria eligen pesos chinos porque se descargan, se afinan con datos locales y no obligan a esperar la aprobación de nadie, hasta el punto de que en OpenRouter ya rondan la mitad del uso.
Sundar Pichai anunció tres movimientos en el mismo mensaje: Jeff Dean se marcha después de veintisiete años, Demis Hassabis pasa a presidir Google DeepMind y a ser científico jefe de Alphabet sin dejar de dirigir Isomorphic Labs, y Koray Kavukcuoglu asume como vicepresidente sénior al frente de los modelos Gemini, la investigación de frontera y las herramientas para desarrolladores. Dean funda con Sanjay Ghemawat, Oriol Vinyals y Quoc Le una corporación de beneficio público, Discovery Loop, que quiere automatizar el bucle experimental de la investigación, empezando por la propia investigación en aprendizaje automático antes de saltar a fármacos y materiales. Alphabet entra como inversora fundadora y proveedora de nube con cómputo para el primer año, la acción cayó cerca de un 4% tras el anuncio, y el mismo texto cifra la aplicación de Gemini en más de 950 millones de usuarios mensuales y los modelos Gemma en más de 900 millones de descargas.
Leer en Google (Sundar Pichai y Demis Hassabis)El instituto británico publicó un informe de incidente sobre su propia evaluación: en 10 de 122 ejecuciones de un mismo reto de ciberseguridad, los agentes actuaron por su cuenta en internet contra personas y organizaciones reales, con 19 acciones catalogadas, 17 del Mythos 5 de Anthropic y 2 del GPT-5.6-Sol de OpenAI. En el caso más grave el agente investigó a los mantenedores de un proyecto abierto y creó varias identidades falsas para convencer a uno de que aceptara código malicioso; el mantenedor se negó y el agente pasó a buscarlo por otras vías. La vigilancia interna saltó al detectar un tráfico anómalo que salía por Tor y todo quedó aislado en cerca de una hora, aunque conviene leer la letra pequeña: las pruebas se hicieron con acceso abierto a internet y con los clasificadores de ciberseguridad de los proveedores desactivados, una combinación que no se parece a la de un despliegue comercial.
El sistema NOVA, de Unit 42, reparte el ciclo de la investigación de vulnerabilidades entre agentes especializados —delimitar, descubrir, escribir la prueba de concepto y validarla en entornos aislados— y en dos meses confirmó 14.090 fallos, el 99,4% nunca reportados y el 39,7% de gravedad alta o crítica. El equipo deja dos hallazgos incómodos para quien esperaba magia de un modelo suelto: el conjunto de modelos gana siempre al mejor de ellos por separado, porque cada uno detecta clases distintas dentro del mismo código, y el 92% de lo encontrado son fallos de lógica, no la corrupción de memoria que suele cazar el fuzzing. La conclusión que dejan es operativa y bastante seca: la ventana de parcheo, que promediaba 55 días, se ha cerrado.
Off-by-1 Labs generó 6.080 parches con ChatGPT 5.5 y Opus 4.8 para seis vulnerabilidades recién divulgadas —entre ellas una ejecución remota en ActiveMQ, otra en Exim y otra en el Gemini CLI— elegidas justamente porque sus arreglos difícilmente estaban en los datos de entrenamiento. El 53,9% no resolvió el fallo, introdujo uno nuevo o ambas cosas, solo el 26% lo cerró sin tocar el comportamiento de la aplicación y otro 20,1% lo cerró alterándolo. Cada intento costó unos 2,11 dólares con el modelo de OpenAI y 2,81 con el de Anthropic, de modo que lo caro de este flujo no es escribir el parche sino comprobar que sirve.
El trabajo bautiza «solution hacking» al hecho de llegar al resultado correcto por caminos que no demuestran nada de lo que el problema pretendía medir: búsqueda numérica, enumeración, adivinar o razonar hacia atrás desde la respuesta. Al revisar el procedimiento y no solo el resultado, entre el 8,2% y el 44,1% de los aciertos acreditados a los modelos punteros son atajos, y la proporción sube con la dificultad: 2,2% en problemas comunes, 28,3% en nivel olimpiada y 37,4% en HLE. Cuando se bloquea el atajo, la precisión declarada cae con fuerza mientras la de las soluciones legítimas apenas se mueve, lo que sugiere que puntuar solo por respuesta final sobrestima el razonamiento científico de estos sistemas.
Meta publicó Muse Spark 1.2 junto al agente de terminal que lo mueve, y el argumento técnico es que el modelo se entrenó dentro de ese mismo agente: las llamadas a herramientas, la compactación del contexto y las recetas de subagentes se afinaron como una sola pieza, aunque la empresa sostiene que el modelo generaliza a otros agentes. Cada sesión queda escrita en un registro de eventos local que se puede auditar con jq y que permite retomar el trabajo donde se cortó tras una caída, y vienen cuatro guías de invocación explícita para planificar, interrogar el plan y filtrar decisiones de diseño. La tarifa estándar es de 1,25 dólares por millón de tokens de entrada y 4,25 de salida, con un nivel contribuidor más barato a cambio de que Meta use esas sesiones para mejorar sus productos, y los pesos, a diferencia de Llama, se quedan en casa.
El diario recorrió Kenia, Uganda, Nigeria y Ghana y encontró el mismo cálculo repetido: pesan más el costo, el cómputo disponible, el control de los datos y el ajuste al idioma local que el país donde se entrenó el modelo. El caso que ordena el reportaje es Sunflower, del ugandés Ernest Mwebaze, levantado sobre Qwen 3 y capaz de manejar 31 idiomas de Uganda; en Kenia, una base de datos legal de cerca de un millón de documentos costó unos 25.000 dólares, cuando con un modelo estadounidense de pago habría superado el millón. En OpenRouter los sistemas abiertos chinos ya rondan la mitad del uso y en Hugging Face copan 19 de los 25 más descargados, aunque el reportaje recoge también el reverso: un chatbot ugandés construido sobre pesos chinos describía a China como una democracia y esquivaba las preguntas sobre su actividad económica en el país, y sus autores acabaron cambiando de modelo.
Vercel propuso la especificación y AWS, Cursor, GitHub, Microsoft y OpenAI la afinaron hasta la versión 1.0 de Agent Plugins: un directorio con un manifiesto mínimo, una carpeta de habilidades y un archivo opcional para configurar servidores MCP, con ChatGPT, Codex, Cursor, GitHub Copilot, Kiro y Visual Studio Code apuntados desde el primer día. El comité técnico reparte a los mantenedores entre cinco empresas y ninguna puede quedarse con la mayoría de los asientos. Lo interesante es lo que queda fuera: la norma no define permisos, aislamiento, firma ni gestión de secretos, y remite a cada cliente la instalación, la distribución y la aplicación de políticas, justo la parte que decide si un plugin ajeno puede hacer daño.
Anthropic reconoció por primera vez que monta un equipo interno de silicio para diseñar chips a medida de Claude, con la idea de codiseñar el modelo y el hardware que lo ejecuta para ganar velocidad y eficiencia. La oferta de empleo pide algo poco habitual en una empresa de software: haber contribuido en persona a cerrar un diseño de semiconductor y enviarlo a fábrica —el «tape-out»—, no solo a investigarlo. La empresa aclara que el equipo se suma a los acuerdos de cómputo que ya tiene con AWS, Google, Nvidia y AMD en lugar de sustituirlos, y no ha dado ni fecha ni fábrica; el movimiento llega después de que OpenAI presentara en junio su chip de inferencia Jalapeño con Broadcom, con Google apoyado en sus TPU y Meta en los aceleradores MTIA.
El punto de partida es que los agentes actuales cometen errores sutiles de inferencia estadística y llegan a conclusiones equivocadas sin que se note en la respuesta final. Los autores publican P-Bench, con 425 tareas abiertas de contraste de hipótesis en economía, biología y medicina, y Fisher-R1, un agente de pesos abiertos entrenado por refuerzo con una recompensa de rigor estadístico. En ese banco de pruebas, la versión de 14.000 millones de parámetros mejora alrededor de un 21% de media el acierto a la primera frente a DeepSeek-V4-Pro y llega al 26% en las tareas más difíciles, y queda también por delante de GPT-5.4.
Herramientas que uso
La plataforma donde vive el newsletter de PX Noticias IA: edición, envíos y analítica pensados para newsletters. Si la pruebas desde este link, ayudas a sostener el briefing.
Conocer Beehiiv →Dictado por voz open source que corre 100% local (Whisper/Parakeet): tu audio nunca sale de tu máquina. Privacidad primero, gratis y multiplataforma.
Visitar OpenWhispr →Quién hace esto
Si tú o tu organización necesitan asesoría, desarrollo o un copiloto con criterio para sus proyectos de software o IA — escríbeme directo. Respondo personalmente todos los mensajes.
Sobre el sitio
PX Noticias IA es un briefing semanal curado de noticias sobre inteligencia artificial, escrito en español. Cada lunes selecciono diez historias entre cientos: papers de arXiv, anuncios de labs, releases con tracción real, debates intelectualmente sustantivos.
No es un agregador. Es un filtro editorial con criterio explícito — prioriza lo novedoso, lo verificable y lo que no está en todos lados esa semana. Si sigues el espacio de IA y quieres un briefing que respete tu tiempo, este es el lugar.