On-screen text
Mô hình ngôn ngữn70 tỷ tham số,nchạy gọn trên một cardnđồ họa phổ thông 4GB.nKhông nén, khôngncắt tỉa, khôngnchưng cất.nAirLLMnbiến chuyện tưởngnthành một dòngncài đặt. Vànnó không dừng ởnrepo nay connnhét được cả mônhìnhnmở lớn nhất thế giớinvào chưa đầy 4GB.nBí quyết nămnhìnhnhoàn toàn khác. Mẹonđó có thể gọi lànsuy luận theo từngnlớp. Mộtnmạng transformernchồng, và khintính toán, dữnliệu đi qua từngnlớp một, lầnnlượt. Vậyntại sao phải nhétncả mô hình vàonGPU cùng lúc?nAirLLMnchỉ giữ đúng mộtnlớp trên GPUntại mỗi thời điểm.nNhờ vậy,nbộ nhớ cần khôngnphụ thuộc vào cỡncả mô hình,ncủa một lớp.nCụ thể nó chạynTách lớpnChia nhỏ kinh theo lớp, lưu ra ổ cứngnTách lớpnNạp 1 lớpnĐua dùng một lớp lên GPUnTình & giải phóngnXong lớp x, trả bộ nhớ ngaynPrefetch lớp kếnNạp trước để chống lấn tính toánnĐề phải ngồinchờ ổ cứng,nnó nạp trước lớp kếnngay trong lúc lớpntính. GPUntính. GPUngần như không bao giờnphải ôm quá mộtnlớp. VànĐúng một dòngnkhông phải làm gì.nCài đặt bằng một lệnhnpip cực ngắn.nRối gọi hàm AutoModel,ntruyền vào tên mô hìnhntrên Hugging Face,nđúng một dòng. Cùngndòng đó chạy đượcnQwen, DeepSeeknhay Llama,nchỉ đổi mỗi cái tên.nToàn bộ việcntách lớp và nạpnra ngầm, bạnnkhông phải đụng tới.nSức hútnCách tiếp cậnnđó chạm đúng nỗinkhát của cộng đồngnGPU eo hẹp.nTrong khoảngnba năm, AirLLMngom hơn 30nnghìn sao và 3,210nlượt fork trên Github.nCon số đó nóinlên một điều: sốnngười muốn chạy mônhình khổng lồ ngayntrên phần cứng nhỏ củanmình nhiều hơnnta tưởng rất nhiều.nVà nó không kénnGần như mọi mô hình mởnLlaman2/3/3.1/3.3/4nGwenn1/2/2.5/3, có MoEnDeepSeeknV2/V3/R1nMistraln& Mistral MoEnPhinMicrosoftnGemmanGooglenchạy được gần nhưnmoi họ mô hìnhnmở phổ biến: Llama,nQwen, DeepSeek,nMistral, Phincủa Microsoft,nGemma của Google,ncùng ChatGLM,nBaichuan haynInternLM.nBạn chỉ cần dánnđúng cái tên trênnHugging Face vào,nphần còn lại giốngnhệt nhau. Mộtnthư viện, gầnnnhư cả thế giớinmô hình mở. Bạnnmới nhất đây giớinhạn xa hơn nữa.nCuối tháng 7 vừanrồi, phiên bảnn3.1 thêmnhỗ trợ Kimi K3,nmô hình 2.8 nghìnntỷ tham số, lớnnnhất trong các mônmở. Tácngiả đo trênnmột card RTXn6000, đỉnhnbộ nhớ chỉ 3.72GB.nVới mô hình thừankiểu MoE,n896 chuyênngia mỗi lớp;nmỗintoken chỉ định tuyểnntới 16, nên AirLLMnchỉ nạpnđúng nhữngnchuyên gia đó,nthay vì cả lớp.nNếu tốc độ là mốinlo, AirLLMncó sẵn một chếnđộ nén tùy chọn.nNénnMặc địnhnKhôngnTốc độn1xnĐộ chính xácnBản gốcnVSnBật nén 4-bitnTheo khốinTới 3xnGần như không đổinTốc độ suy luận nhanhnhơn tới ba lần,nmà độ chính xác gầnnnhư không đổi. Mặcnđịnh thì tắt đểngiữ nguyên bản gốc;nai cần nhanh mới bật.nĐây là lựanchọn của bạn,nkhông phải mặc định épnbuộc. Nhưngnphải nói thẳng cái giáncủa nó. Vìnmỗi lớp đều nạpnlại từ ổ cứng,ntốc độ bị nghẽn hoànntoàn ở đĩa,nkhông phải GPU. VớinKimi K3,ntác giả đo được khoảng 900 giây để dùngnPhải lưu có bản mô hình đã tách lớp.nĐọc địa liên tụcnTốc độ bị chọn bối cảnh, không phải GPUnĐây là công cụnđể chạy được thứnvốn bất khả thi,nchứ không phảinđể phục vụ thật nhanh.n"Chạy được và dùng được mượt là hainchuyện hoàn toàn khác nhau."nẤn tượng, nhưngncó nghĩa là dùng được.nKimi K3nmất tới 292ngiây cho một token,nđược vài chục chữ,nkhông thể trò chuyện.nAirLLMngiỏi ở chỗnnhét vừa mô hình vàonmáy; còn muốnnGPU yếunvẫn chọn lượng từnhóa, thứnmà AirLLMncố tình bỏ qua.nBạn sẽ thử chạy mô hình nàonđầu tiên?nkhiêm tốn vàntò mò muốn chạynbiến mọi nội dung thành video trong vàinphút.nLink, chủ đề, file hay video - ainius dụng video cho bạn.nBắt đầu miễn phí tại ainius.netnainius.netnLink repo AirLLM ở phần mô tảnBạn sẽ thử chạy mô hình nàonđầu tiên?nBiến mọi nội dung thành video trong vàinphút.nLink, chủ đề, file hay video - ainius dụng video cho bạn.nBắt đầu miễn phí tại ainius.netnainius.net