Hook
More breakout videos from this creator.
Thời đại của việc phải bỏ vài trăm triệu mua card đồ họa khủng, mới dám đụng vào model 70 tỷ tham số, kết thúc rồi anh em ạ. Cứ nghĩ muốn chạy AI khủng ở nhà thì phải có GPU khủng, không thì chịu đi thuê cloud tốn tiền. Kịch bản quen thuộc thế này, lúc đầu định tự host một con model 70B để code, để chat riêng tư, không lo lộ dữ liệu. Tải model về xong, load lên con GPU 4GB của mình là nó báo lỗi CUDA Out Of Memory ngay lập tức. Loay hoay đi. Quantize để vừa VRAM thì model trả lời tệ, đành thuê cloud tốn tiền. Cắt bớt ngu hẫn đi. Quantize: Model Ngu Đi. Thuê Cloud: Tốn Tiền. TỔNG TÀI AI • @tongtaiai.com. Không tại GPU yếu. Framework nào cũng nhét cả model vào VRAM, trong khi GPU chỉ cần đúng 1 lớp. Nhét cả khối: kẹt. 1 lớp một lúc: vừa. TỔNG TÀI AI • @tongtaiai.com. 33 Nghìn Sao AirLLM. AirLLM của Gavin Li, hơn 33 nghìn Stars, giấy phép Apache 2.0 miễn phí. TỔNG TÀI AI • @tongtaiai.com. Dừng Load Hết 1 Lúc. Không nén, không chưng cất, không cắt bớt model — chỉ cần load từng phần. Không Nén/Chưng Cất/Cắt. Chỉ Cần Load Từng Lớp. TỔNG TÀI AI • @tongtaiai.com. 1 Lớp 1 Lúc Thôi. 70B chạy gọn 4GB VRAM, 405B Llama 3.1 chạy vừa trên 8GB. TỔNG TÀI AI • @tongtaiai.com. Nén Model Nhanh 3 Lần. Bật compression '4bit'/'8bit' cùng bitsandbytes, tốc độ tăng gấp 3. How to enable model compression speed up: Step 1, make sure you have bitsandbytes installed by pip: pip install -U bitsandbytes Step 2, make sure airllm version later than 2.0.0: pip install -U airllm Step 3, when initialize the model, passing the argument compression ('4bit' or '8bit') model = AutoModel.from_pretrained("garage-saucelabs/flan-t5-xl", quantization="4bit") TỔNG TÀI AI • @tongtaiai.com. Prefetch Nhanh 10%. Nạp lớp kế tiếp song song lúc GPU đang tính — nhanh thêm 10%. GPU: [2023/12/25]v2.8.2: Support MacOS running 70B large language models. [2023/12/25]v2.8.2: Support AirLLMExtra. [2023/12/28]v2.8: Added AutoModel, automatically detect model type, no need to provide model class to initialize model. [2023/12/18]v2.5: Added prefetching to overlap the model loading and compute. 10% speed improvement. TỔNG TÀI AI • @tongtaiai.com. MoE Stream Từng Expert. Qwen3.8-Flash-Next 125 tỷ tham số chỉ ăn 5,95GB VRAM. TỔNG TÀI AI • @tongtaiai.com. Cực Đại Dưới 4GB. DeepSeek-V3 671B chạy ~12GB, Kimi K3 2,8 nghìn tỷ tham số chạy dưới 4GB. TỔNG TÀI AI • @tongtaiai.com. 1 Dòng Lệnh Mọi Model. AutoModel.from_pretrained dùng chung cho Llama, Qwen, DeepSeek, Mistral... TỔNG TÀI AI • @tongtaiai.com. Miễn Phí Vẫn Cập Nhật. Apache 2.0 hoàn toàn miễn phí, cập nhật tới tháng 8, chạy được cả MacOS. TỔNG TÀI AI • @tongtaiai.com. Cài Đặt 1 Dòng Lệnh. pip install airllm 1. Install package First, install the airllm pip package. pip install airllm 2. Inference TỔNG TÀI AI • @tongtaiai.com. Bạn Làm Chủ VRAM. Gõ pip install airllm ngay hôm nay. Anh em nghĩ sao về layer streaming? pip install airllm Bạn Làm Chủ VRAM TỔNG TÀI AI • @tongtaiai.com