Fathom
Asistente de IA que graba, transcribe y resume tus reuniones (Zoom, Meet, Teams). Lo uso a diario. Si te suscribes desde este link, recibo créditos que sostienen PX Noticias IA.
Conocer Fathom →El razonamiento cifrado salta entre modelos y filtra 182 credenciales, un modelo de 14 MB cabe en un ESP32 y de 500 materiales nuevos solo uno se puede fabricar: a la IA se le vieron las costuras.
Ocho investigadores encontraron que los bloques de razonamiento cifrado que los grandes proveedores devuelven al cliente son intercambiables entre sesiones, usuarios y modelos, así que basta con inyectarlos en un modelo hermano más débil para que los transcriba en claro: a partir de 6.708 trayectorias públicas de agentes recuperaron 367 datos personales y 182 credenciales.
La segunda lección del mismo trabajo es de diseño y no de criptografía: la firma que protege esos bloques no está atada al contexto, de modo que un atacante puede esconder instrucciones dentro del razonamiento y el modelo las trata como pensamiento propio, precisamente lo que menos suele poner en duda.
La respuesta de la industria llegó la misma semana y también en clave criptográfica: Anthropic anunció que sus próximos modelos marcarán el texto con SynthID-Text y Google liberó HEIR, un compilador que convierte modelos ya entrenados para que calculen sobre datos que nunca se descifran.
Los pesos abiertos tuvieron su mejor semana en meses y también su letra pequeña: Qwen publicó por primera vez el punto de control de un modelo de clase Max, 2,4 billones de parámetros con 95.000 millones activos, aunque llegó sin visión y con el razonamiento obligatorio, y Z.ai retrasó dos semanas los pesos de GLM-5.3 por una revisión de seguridad.
Y la nota que mejor ordena las expectativas vino de los materiales: siete modelos de vanguardia propusieron más de 500 compuestos nuevos que cumplen las cinco condiciones físicas del problema, pero al pedirles la receta de fabricación solo una ruta resultó plausible para los expertos que evaluaron las recetas.
Los grandes proveedores esconden la cadena de pensamiento de sus modelos y se la devuelven al cliente como bloques cifrados que este reenvía en cada petición; el trabajo muestra que esos bloques son intercambiables entre sesiones, usuarios y modelos del mismo proveedor, así que basta con inyectarlos en un hermano menos protegido para que los suelte en claro sin tocar al modelo caro. Con esa palanca los autores demuestran cuatro usos: destilar razonamiento ajeno, recuperar información privada —sobre 6.708 trayectorias públicas de agentes descifraron 315.320 bloques y sacaron 367 datos personales y 182 credenciales—, reconstruir contenido peligroso que la respuesta visible había rechazado y esconder inyecciones de instrucciones dentro del propio razonamiento. Lo incómodo para la defensa es que el atacante nunca consulta al modelo de vanguardia: el cómputo caro ya lo pagó otro usuario, de modo que quien vigila ese extremo puede no ver nada.
Leer en arXivZhipu presentó GLM-5.3 sobre la misma base de 743.000 millones de parámetros que ya usaba GLM-5.2: todo lo que gana viene de alargar el postentrenamiento, sobre todo metiendo al modelo en entornos simulados de trabajo profesional. El salto grande no está en programar sino en seguridad ofensiva, el terreno donde los modelos chinos venían flojos: ExploitBench pasa de 24,4% a 54,4%, el laboratorio dice que el modelo empezó a planificar cadenas de explotación completas en varias etapas, y de ahí salen 2.436 vulnerabilidades señaladas en 269 proyectos abiertos con 53 CVE ya publicados. Por eso mismo los pesos no salieron el mismo día: la empresa los promete en unas dos semanas, cuando termine la evaluación de seguridad, y hasta entonces solo hay API y suscripción.
Alibaba publicó en Hugging Face y ModelScope el punto de control que hay detrás de Qwen3.8-Max: 2,4 billones de parámetros totales con 95.000 millones activos por token, mezcla de expertos de grano fino con 512 expertos, atención completa cada cuatro capas y lineal en las otras 69, y una ventana nativa de 262.144 tokens ampliable a poco más de un millón. La letra pequeña llegó por partida doble: el modelo abierto es solo de texto y obliga a razonar siempre, sin la entrada multimodal ni el modo sin razonamiento que sí tiene el servicio de pago, y la licencia no es Apache sino una que Qwen escribió para esta versión. vLLM lo admite desde el primer día, aunque para servirlo hacen falta al menos dos nodos B300 de Nvidia o MI355X de AMD, o uno solo si se baja a cuantización de cuatro bits.
BDH-CQ, del equipo de Pathway, deja atrás la arquitectura Transformer y parte de Dragon Hatchling: activaciones positivas de alta dimensión, comunicación de rango bajo y un estado asociativo recurrente. Los ejemplos que recibe en la petición van actualizando esa memoria recurrente y luego el modelo itera en un espacio latente continuo en vez de escribir su razonamiento, sin ajustar un solo parámetro para cada tarea, a diferencia de los solucionadores recursivos que se entrenan problema a problema. Con 150 millones de parámetros llega a 29,5% pass@2 en ARC-AGI-1 (118 de 400) y a 59,38% en ConceptARC con un costo de unos 0,85 segundos de H200 por tarea, cerca de 57 veces más barato que GPT-5.6 Luna, lo que corre la frontera de Pareto entre costo y acierto.
Material Discovery Bench pone a siete modelos de vanguardia, con búsqueda web, entorno de Python y herramientas de simulación, a buscar dieléctricos que conduzcan bien el calor —el cuello de botella que hoy frena el apilado de chips en tres dimensiones— con presupuestos de hasta cien millones de tokens por ejecución. Todos encontraron compuestos nuevos y dinámicamente estables que cumplen las cinco condiciones a la vez: conductividad térmica por encima de 20 W/(m·K), constante dieléctrica por debajo de 10, módulo de Young de 20 GPa o más y módulo de cizalladura de 6 GPa o más. La trampa aparece al pedir cómo fabricarlos: de los más de 500 materiales publicados, solo una ruta de síntesis pareció plausible a los evaluadores, con un 81% de recetas gravemente defectuosas en el mejor modelo y un 96% en Opus 5.
Los próximos modelos de Claude llevarán una marca de agua en el texto, con el método SynthID-Text de Google DeepMind: no se toca lo que se escribe, sino la fuente de aleatoriedad con la que el modelo elige entre palabras igual de válidas, de modo que después se puede comprobar si la secuencia encaja con la clave. La empresa lo enmarca en el reglamento europeo de IA y en el código de buenas prácticas sobre transparencia que firmaron unas 190 organizaciones en julio, y aclara que la marca no guarda nada del usuario ni cambia el precio ni el rendimiento. También publica los límites, que son varios: no separa lo que Claude escribió de lo que solo editó, se diluye en pasajes cortos o de terminología muy fija, donde hay pocas alternativas entre las que elegir, y una reescritura completa la borra.
El cifrado homomórfico permite operar sobre datos cifrados sin descifrarlos, pero llevar un modelo a ese régimen exigía hasta ahora un equipo de criptógrafos; HEIR es la cadena de compilación con la que Google quiere automatizar ese paso, y la publica como código abierto. Para enseñar que ya sirve para algo, muestran cuatro casos completos —detección de fraude, detección de amenazas de red, recomendación de contenidos y detección de la palabra de activación— medidos en un solo hilo de CPU, y trabajan con fabricantes de aceleradores como Belfort Labs, Niobium, Cornami y Optalysys. El sobrecosto sigue sin ser trivial, reconoce Google, pero cae rápido, y ahí está el argumento de fondo: la privacidad deja de ser una promesa contractual y pasa a ser una propiedad del cómputo.
El nivel Ultrafast corre el modelo más capaz de OpenAI sobre el motor de escala de oblea de Cerebras, que guarda 44 GB de SRAM en el propio chip y se ahorra el viaje constante a la memoria externa que estrangula a las GPU. Son hasta 750 tokens de salida por segundo, unas catorce veces el nivel estándar, que ronda los 53: en la prueba que publica Cerebras, contestar las 2.500 preguntas de Humanity's Last Exam llevó 11 horas y 11 minutos, frente a las 78 horas y 27 minutos de Claude Fable 5. Conviene anotar de dónde vienen esos números —son mediciones del propio fabricante— y que el nivel sigue en vista previa limitada, sin precio publicado ni fecha de disponibilidad general.
Cactus no cuantizó el modelo al final sino desde el preentrenamiento: pesos, activaciones y caché de claves y valores se entrenaron ya a dos bits, así que el binario de 14 MB contiene exactamente el modelo que se entrenó. Con eso, 45 millones de parámetros caben en unos 28 MB de memoria por sesión —techo que permite correrlo en microcontroladores como el ESP32-S3— y gasta 70 MFLOPs por token frente a los 460 de LFM2.5 230M, con una ventana deslizante de 256 tokens que mantiene el consumo constante por larga que sea la conversación. En llamadas a herramientas se mide de tú a tú con modelos de 5 a 70 veces su tamaño, y ronda los 500 tokens por segundo en una Raspberry Pi 5.
Salvatore Sanfilippo publicó un motor de inferencia para MiniMax-H3, el modelo de video y audio cuyos pesos MiniMax liberó una semana antes, escrito en C puro y Metal, sin Python ni PyTorch, con licencia MIT y sin distribuir pesos ajenos. La gracia está en el detalle de ingeniería: núcleos DiT fusionados, rutas BF16 e int8, reutilización de memoria de activaciones y codificación del texto de entrada en flujo dejan un modo de cuatro pasos que saca un video de 22 fotogramas en unos 3,5 segundos en un M5 Max, cuando por los caminos habituales en Mac la misma tarea se cuenta en decenas de minutos; la contrapartida es que una GPU discreta sigue muy por delante en difusión.
Herramientas que uso
Asistente de IA que graba, transcribe y resume tus reuniones (Zoom, Meet, Teams). Lo uso a diario. Si te suscribes desde este link, recibo créditos que sostienen PX Noticias IA.
Conocer Fathom →El asistente de IA de Microsoft, integrado en Windows y Office. A mano si vives en ese ecosistema y quieres IA sin cambiar de herramienta.
Visitar Microsoft Copilot →Quién hace esto
Si tú o tu organización necesitan asesoría, desarrollo o un copiloto con criterio para sus proyectos de software o IA — escríbeme directo. Respondo personalmente todos los mensajes.
Sobre el sitio
PX Noticias IA es un briefing semanal curado de noticias sobre inteligencia artificial, escrito en español. Cada lunes selecciono diez historias entre cientos: papers de arXiv, anuncios de labs, releases con tracción real, debates intelectualmente sustantivos.
No es un agregador. Es un filtro editorial con criterio explícito — prioriza lo novedoso, lo verificable y lo que no está en todos lados esa semana. Si sigues el espacio de IA y quieres un briefing que respete tu tiempo, este es el lugar.