Hook
More breakout videos from this creator.
Esta noticia es una locura. Por primera vez, un modelo de inteligencia artificial se escapó de su encierro, hackeó a una empresa y todo para copiar en su propio examen de hacking. Déjame te lo explico desde cero. Open AI estaba probando sus modelos en un benchmark. Un benchmark es como un examen estandarizado para medir qué tan bueno es una IA en algo. En este caso era el gym y mide una sola cosa: qué tan bien la IA puede hackear. Y para estas pruebas, empresas les entregan modelos sin los filtros de seguridad, a propósito. Les quitan los candados que a ti y a mí nos para pedir cosas peligrosas. Justo para ver hasta dónde llegan haciendo lo que nosotros no podemos. Las respuestas de ese examen estaban guardadas en Hugging Face. Para que me entiendas, Hugging Face es el gran almacén público de la inteligencia artificial. Ahí cualquiera sube sus modelos, descarga los de otros o agarra uno y lo entrena para lo suyo. Eso se llama fine-tuning. Es un servicio buenísimo que lo usa medio mundo de la inteligencia artificial. Y escucha esto, no fue solo modelo, fueron dos de OpenAI trabajando juntos, GPT 5.6 y otro aún más potente que todavía no ha salido al público. Que yo estoy casi seguro que es GPT 6. Los tenían encerrados en una caja sin internet y solo tenían permiso instalar programas, nada más. Ahí encontraron una que nadie conocía. A eso se le llama zero day y la usaron para escapar a internet. Ya afuera hackearon los Face con credenciales robadas para llevarse las del examen. Y esto se pone más loco. A estos modelos no los programaron para hackear. Lo decidieron solos, obsesionados con una pasar el examen. Para esa meta tan pequeña, rompieron su jaula y atacaron una empresa. Desalineación. Cuando la IA persigue el objetivo que le diste, pero de una forma que tú quisiste. Y no fue un caso aislado. Esta gráfica mide qué lejos llega un modelo hackeando la red de una empresa. Del primer paso hasta el control total. Los modelos viejos se quedan en la mitad, los nuevos llegan hasta GPT 5.6 en su máxima capacidad completó el ataque entero. Para mí esto se siente como los inicios de la AGI.