Hook

Their other posts in the index, biggest breakout first.
Un sviluppatore italiano da solo sta avendo più impatto nella community AI che tante grandi aziende. Il suo nuovo progetto è l'obiettivo di portare i modelli di frontiera nel tuo PC di casa. Sto parlando di Salvatore Sanfilippo, creatore di Redis, uno dei più forti programmatori in Italia nel mondo, divulgatore scientifico, autore che da lanciato in questo nuovo progetto in AI e da subito ha fatto la differenza nel settore. Il progetto si chiama DwarfStar, è subito diventato virale su GitHub. Ha creato un engine proprio come Llama, o Llama C++ o Studio VLL, che si chiama DS4 abbreviato, è specializzato ed ottimizzato per la famiglia di modelli di DeepSeek. Normalmente questi modelli sono enormi e hanno bisogno di un cluster GPU, ma grazie a DwarfStar, far girare su hardware consumer, quindi un MacBook Pro o Nvidia DGX Spark GB10 che hanno 128GB di memoria unificata, che hanno 128GB di memoria unificata. Riescono anche a girare abbastanza bene dandoti una user experience dai 21, 25, 35 token al secondo. I segreti sono: ha una quantizzazione dinamica, quindi invece di quantizzare tutto il modello, identifica le parti da quantizzare di più, le quantifica a 2 bit e quindi 8 bit e quindi il modello preserva diminuendo lo spazio modo tale che entra nel PC. Ha aggiunto l'SSD streaming. Se anche con la quantizzazione la tua RAM non è sufficiente, beh, puoi usare la SSD memoria per far girare il modello, soprattutto su DS4, Mixer of Experts, dove ci sono tanti esperti per ogni layer. Ha capito quali sono gli esperti che vengono chiamati sempre, quelli che vengono chiamati più spesso, quelli che vengono chiamati più raramente li li mettiamo nella SSD, gli altri li carichiamo nella memoria, creiamo delle code e se serve andiamo a caricare in streaming dall'SSD alla memoria e dalla memoria SSD, super geniale, permettendoci di far girare modelli tipo DS4 su 64GB di memoria che era impossibile prima. Altra cosa che ha fatto quando un computer non basta, con tutte queste ottimizzazioni puoi collegare 2 computer sia tramite cavo o in rete, cavo internet o Wi-Fi o addirittura VPN. Ed usare 2 computer insieme. Sul MacBook puoi usare il Thunderbolt e i due PC si dividono i layer del modello e possono calcolare insieme eh i token. Facendo differenza distribuita su Thunderbolt 5, Wi-Fi o addirittura VPN. Qua vediamo i risultati. Ha fatto tantissime altre ottimizzazioni che ho spiegato in dettaglio in un video. Se vuoi approfondire in dettaglio lo trovi sul mio canale. Ed è incredibile come da solo abbia creato questo progetto tutto italiano, tutto open source gratuito che realmente sta facendo la differenza della community locale? Perché adesso con DwarfStar, il problema è se posso far girare questo il problema è quanto veloce mi andrà. Sogno di tutti, modelli di frontiera così sul proprio computer. Fammi sapere con un commento cosa ne pensi e seguimi per rimanere aggiornato sul mondo delle AI. Ciao!