Strata, dự án của Niko1221, đã chứng minh khả năng chạy mô hình ngôn ngữ lớn (LLM) 125 tỷ tham số trên phần cứng gaming thông thường, mở ra cơ hội thử nghiệm LLM mà không cần siêu máy tính.
Điểm chính
Strata hỗ trợ các biến thể của mô hình Qwen3.8, bao gồm các phiên bản lượng tử hoá và các mô hình chuyên dụng cho lập trình. Phiên bản Qwen3.8‑Flash‑Next là mô hình mixture‑of‑experts với 24 576 chuyên gia nhỏ, trong đó chỉ 10 chuyên gia được kích hoạt cho mỗi token.
Kiến trúc phần mềm xử lý VRAM như một bộ nhớ đệm: các chuyên gia thường dùng được giữ trên GPU, còn toàn bộ tập hợp chuyên gia nằm trong RAM hệ thống. Một bảng tra cứu khoảng 29 GB được lưu trên SSD và được truy cập khi cần.
Theo dự án, một card RTX 5070 với 12 GB VRAM có thể tạo ra khoảng 50‑90 token mỗi giây, tùy vào mức lượng tử hoá. Để chạy Strata, cần ít nhất 32 GB RAM hệ thống, 12 GB VRAM và khoảng 80 GB dung lượng lưu trữ.
Phần mềm cung cấp giao diện web và các API tương thích OpenAI/Anthropic trên localhost, cho phép các công cụ chat, trợ lý lập trình và các ứng dụng khác sử dụng mô hình nội bộ mà không cần thay đổi lớn.
💡 Góc nhìn kỹ thuật Hagapa
Kiến trúc cache VRAM‑RAM‑SSD của Strata có tiềm năng áp dụng cho các thiết bị IoT nhúng có GPU tích hợp, giúp mở rộng khả năng xử lý AI trên các bo mạch công nghiệp mà không tăng đáng kể chi phí phần cứng. Tuy nhiên, yêu cầu tối thiểu 32 GB RAM và SSD lớn vẫn là rào cản đối với các thiết bị nhúng truyền thống; cần cân nhắc tối ưu hoá mô hình hoặc dùng phiên bản lượng tử hoá thấp hơn cho các ứng dụng cảm biến, giám sát PCCC tại Việt Nam.