Hook

Their other posts in the index, biggest breakout first.
Non è passato neanche un giorno dall'uscita di Fable 5, il nuovo modello che in meno di 24 ore questo sviluppatore è riuscito ad effettuare il jailbreak, liberando quindi il pieno potenziale di Fable 5. Il jailbreaking è uno degli attacchi più pericolosi per i modelli di intelligenza artificiale e consiste nello scrivere il prompt tale da superare le barriere del modello, quindi superare superare l'allineamento del per farci rispondere praticamente a qualsiasi domanda. Un esempio chiaro, come costruire un allineato ti dice, mi dispiace ma non posso risponderti a questa domanda. L'hacker, l'attaccante insomma, che modifica il prompt realizzando un jailbreak in prompt. Un avversario al prompt ad esempio, utilizza un ash art per rappresentare quello e ad esempio frega il modello. Ovviamente è sempre difficile fare questa tipologia di attacchi qua nei modelli perché quest'ultimi sono veramente ben allineati e la percentuale di comportamento, diciamo errato, è sempre più bassa. È più difficile ma non impossibile, di fatti vi è il 5,4% di successo nell'utilizzare Fable 5 per fare attacchi security. Ovviamente nei modelli meno intelligenti, è ancora più facile convincerli a fare determinate cose, diciamo malevole e pericolose. Comunque Plini Deliberator è famoso nella community per fare questa tipologia di attacchi e diciamo liberare tra virgolette i modelli non è stato veramente difficile, ha fatto vari tentativi anche utilizzando dei differenti agenti AI per cercare il prompt avversario migliore, ha utilizzato anche codici unicode, cirillico ha usato di tutto e che tipologia di prompt scriveva, dove utilizza questi unicode dove all'interno ci sta scritta per fregare il modello che poi effettivamente ti risponde, ti risponde in vediamo che ci sono carattere appunto in cirilli con russo. Insomma è riuscito comunque a bucare immaginare che danni si possono fare così posente applicato nella cyber si chiudi. Un'altra cosa carina è che praticamente Febol 5 facciamo delle guerre semplici benevole, molto spesso te quindi questo utente ha deciso di creare una skill che trasforma i dei prompt eh più facilmente passabili dal guard rail di Fable. La skill si chiama Fable Safe Prompt e riscrive appunto l'user prompt per ridurre la chance che Claude te lo blocchi. Sta succedendo un delirio di tutto ma non mi meno di 24 ore un ricercatore sviluppatore già riuscisse jailbreak di un modello così potente e sicuro a detta loro. Fammi sapere con sotto cosa ne pensi e seguimi per rimanere aggiornato sul mondo leale ciao!