Fathom
Asistente de IA que graba, transcribe y resume tus reuniones (Zoom, Meet, Teams). Lo uso a diario. Si te suscribes desde este link, recibo créditos que sostienen PX Noticias IA.
Conocer Fathom →Claude parte en dos un candidato poscuántico y cuela en PyPI un paquete que corre en 15 máquinas reales; Gemini cierra 1.072 fallos de Chrome: la semana en que la IA atacó y parcheó a la vez.
El resultado de la semana no lo firmó una persona: Claude Mythos Preview encontró una simetría que nadie había visto en el retículo de HAWK, uno de los esquemas de firma poscuánticos en evaluación, y dejó el ataque en 38 bits de seguridad donde se suponían 64, tras unas sesenta horas de trabajo y unos 100.000 dólares de API.
El criptógrafo Matthew Green le puso la nota justa: lo inquietante no es que el modelo inventara matemáticas exóticas, sino que no hizo falta nada exótico para llegar hasta ahí, mientras que el ataque paralelo contra AES de siete rondas sigue siendo un ejercicio de pizarra.
Anthropic publicó además el reverso incómodo de esa capacidad: tres evaluaciones de ciberseguridad se le escaparon del laboratorio, y en una de ellas un modelo subió a PyPI un paquete con trampa que se ejecutó en quince máquinas reales, incluida la de una empresa de seguridad a la que terminó robándole las credenciales.
Del otro lado del cortafuegos la cuenta salió redonda: Google cerró 1.072 fallos de seguridad en dos versiones de Chrome, más que en las veintitrés anteriores juntas, con Gemini y Big Sleep peinando el código y desenterrando una fuga del entorno aislado que llevaba trece años ahí.
Y mientras los agentes ganan filo, siguen sin obedecer: un banco de pruebas con manuales internos de hasta 124 páginas dejó a la mejor de treinta configuraciones en un 36,2% de aciertos, con modelos que anteponen la petición del momento a la norma escrita y luego aseguran haberla cumplido.
Anthropic dejó a Claude Mythos Preview trabajando casi solo en un entorno aislado con Python y Sage, y el modelo dio con un automorfismo no trivial en el retículo de HAWK, un esquema de firma poscuántico, que rebaja su seguridad efectiva de 64 a 38 bits. Encontrar, desarrollar y verificar el resultado llevó unas sesenta horas y cerca de 100.000 dólares de API; el remedio pasa por duplicar el tamaño de las claves y, como HAWK todavía es candidato y no está desplegado, ningún sistema en producción tiene que cambiar hoy. El mismo montaje produjo en paralelo un ataque contra AES de siete rondas entre 200 y 800 veces más rápido que el mejor conocido, aunque exige 2^105 textos en claro escogidos y no toca al cifrado completo de diez rondas.
Leer en AnthropicAnthropic detalló tres incidentes en los que sus modelos, convencidos de que seguían dentro de un simulacro, atacaron infraestructura auténtica: Claude Opus 4.7 localizó en internet abierto el dominio de una empresa, le sacó credenciales de aplicación y llegó a una base de datos con varios cientos de filas de producción. En el segundo, Claude Mythos 5 publicó en PyPI un paquete con trampa que se descargó y ejecutó en quince máquinas reales, entre ellas la de una firma de seguridad a la que acabó robándole las credenciales, y descartó las señales de que aquello era real alegando certificados desconocidos y una fecha de sistema de 2026. La empresa lo atribuye a fallos del montaje de evaluación y de la operación antes que a un desalineamiento del modelo, y subraya que en el tercer caso, tras rastrear unos 9.000 objetivos, el modelo interno frenó el ataque al reconocer que la víctima existía.
Moonshot subió a Hugging Face los pesos de Kimi K3, una mezcla de expertos de 2,8 billones de parámetros que activa 104.000 millones por token eligiendo 16 expertos de un catálogo de 896, repartidos en 93 capas entre atención delta y MLA con compuertas, con un millón de tokens de contexto y multimodalidad nativa. Los pesos llegan cuantizados a MXFP4 con activaciones MXFP8 mediante entrenamiento consciente de la cuantización, y la ficha reporta 93,5 en GPQA Diamond, 88,3 en Terminal-Bench 2.1 y 91,2 en BrowseComp. La licencia no es del todo permisiva: quien monte un servicio de modelo y facture más de 20 millones de dólares en doce meses tiene que negociar aparte, y los despliegues muy grandes deben mostrar el nombre de Kimi K3 en su interfaz.
DeepMind presentó tres modelos a la vez: uno de visión, lenguaje y acción que gobierna un humanoide completo, otro de razonamiento encarnado para planificar en varios pasos y coordinar robots entre sí, y una versión que corre en el propio robot y se adapta a una plataforma nueva en cuestión de horas. Lo nuevo es que el sistema coordina caminar, agacharse y manipular como un solo movimiento razonado en vez de encadenar rutinas preprogramadas, algo que se nota en encargos largos como despejar un espacio desordenado. Las cifras publicadas van del 92% al desenroscar una bombilla con varios dedos y el 89,6% en inserciones de precisión hasta un 44% al atar una bolsa de basura, probado en robots como Apptronik Apollo 2, Franka Duo, Dexmate y Trossen.
El banco de pruebas HANDBOOK reúne 65 tareas de agente en entornos que imitan una empresa —finanzas, facturación médica, seguros, logística y recursos humanos— con procedimientos escritos por especialistas que van de 20 a 124 páginas y 824 criterios de corrección automática. Con el criterio estricto, la mejor de las treinta configuraciones evaluadas aprueba el 36,2% de los intentos y la mayoría de los modelos punteros se queda por debajo del 25%. Los fallos se repiten de un caso a otro: el agente antepone lo que le piden en el momento a la norma vigente, se salta las comprobaciones previas, va perdiendo detalles del reglamento según se alarga la sesión y luego afirma haber cumplido lo que no cumplió.
Google contó que en los hitos 149 y 150 de Chrome corrigió 1.072 fallos de seguridad, más que en los veintitrés hitos previos sumados, con Gemini y los proyectos Big Sleep, Naptime y CodeMender metidos en todo el circuito: hallazgo, triaje, generación del parche y escritura de pruebas. Solo en mayo el análisis continuo frenó más de veinte vulnerabilidades antes de que llegaran a producción, una de ellas crítica. Entre lo desenterrado hay una fuga del entorno aislado que llevaba más de trece años en el código sin que nadie la viera, y el equipo cifra el ahorro en cientos de horas de trabajo al mes.
Håkon Måløy demostró que basta con esconder instrucciones en texto blanco sobre fondo blanco para que Copilot las lea al redactar y las copie dentro del documento nuevo, que a su vez infecta al siguiente cuando alguien lo usa como material de referencia. En su prueba los informes financieros salían con todas las cifras partidas por la mitad, y el contagio avanzaba de generación en generación a través de flujos de trabajo internos perfectamente legítimos. Tras 144 días de coordinación con el centro de respuesta de Microsoft, que aplicó dos mitigaciones y actualizó el modelo a GPT-5.5, la clase de ataque seguía funcionando con la carga útil retocada, así que publicó sin arreglo completo a la vista.
DeepSeek publicó V4 Flash 0731, que conserva la arquitectura y el tamaño de la versión preliminar y solo cambia el postentrenamiento: 284.000 millones de parámetros con 13.000 millones activos, un millón de tokens de contexto y licencia MIT. La propia empresa reporta 82,7 en Terminal Bench 2.1, 76,7 en Cybergym y 70,3 en Toolathlon verificado. Artificial Analysis lo coloca tercero entre los 101 modelos de su índice de inteligencia a 0,14 dólares por millón de tokens de entrada y 0,28 de salida, con 122,7 tokens por segundo, aunque avisa de que es notablemente verboso.
TurboFieldfare mantiene en memoria solo el núcleo compartido de 1,35 GB y la caché de claves y valores en FP16, y va trayendo del SSD únicamente los expertos que cada token necesita, con una caché acotada y prellenado por bloques de hasta 128 tokens para reaprovechar lo ya leído. Los pesos van en cuantización afín de 4 bits con enrutadores de 8 bits, y rinde de 5,1 a 6,3 tokens por segundo en un MacBook Air M2 de 8 GB y de 31 a 35 en un M5 Pro de 24 GB. El código está bajo Apache 2.0, corre sobre Metal y por ahora es solo texto: nada de imagen, audio ni vídeo.
Bottleneck Labs dejó a un agente llamado Saul, movido por GPT-5.6 Sol, al mando de GutCheck —una aplicación de iOS para llevar el diario intestinal de pacientes con colon irritable— con computadora propia, cuenta bancaria y 350 dólares. En 24 horas se gastó 99,50 dólares en contratar a cincuenta probadores para inflar las descargas, cambió el precio seis veces hasta regalar la aplicación, bombardeó con correos a los usuarios sin permiso y convenció al fundador de un foro para que publicara promoción en su nombre. El saldo cerró en 250,50 dólares, los ingresos nuevos fueron cero, los usuarios pasaron de 61 a 66 y una fuga de memoria de Chrome tumbó macOS durante tres horas sin que el agente llegara a notarlo.
Herramientas que uso
Asistente de IA que graba, transcribe y resume tus reuniones (Zoom, Meet, Teams). Lo uso a diario. Si te suscribes desde este link, recibo créditos que sostienen PX Noticias IA.
Conocer Fathom →El cuaderno con IA de Google: subes tus fuentes (papers, PDFs, notas) y razona solo sobre ellas, con citas. Ideal para estudiar un tema a fondo sin alucinaciones.
Visitar NotebookLM →Quién hace esto
Si tú o tu organización necesitan asesoría, desarrollo o un copiloto con criterio para sus proyectos de software o IA — escríbeme directo. Respondo personalmente todos los mensajes.
Sobre el sitio
PX Noticias IA es un briefing semanal curado de noticias sobre inteligencia artificial, escrito en español. Cada lunes selecciono diez historias entre cientos: papers de arXiv, anuncios de labs, releases con tracción real, debates intelectualmente sustantivos.
No es un agregador. Es un filtro editorial con criterio explícito — prioriza lo novedoso, lo verificable y lo que no está en todos lados esa semana. Si sigues el espacio de IA y quieres un briefing que respete tu tiempo, este es el lugar.