Mô hình này khớp với công việc đã chọn và nằm trong mức bộ nhớ an toàn mà bạn đã nhập.
ollama run gemma4:e2b-it-qatCho LocalLens biết dung lượng RAM, GPU và công việc bạn muốn làm. Công cụ sẽ đề xuất mô hình và engine phù hợp để bạn không phải tải thử một tệp quá lớn.
Kiểm tra máy của tôi ↓Nếu bạn không biết dung lượng bộ nhớ GPU, hãy chọn 0 GB. LocalLens sẽ đưa ra lựa chọn thận trọng dựa trên RAM.
Phù hợp với người mới vì lệnh cài đặt và chạy mô hình ngắn, dễ lặp lại.
Kết quả dùng mức an toàn cho tệp lượng tử hóa Q4 và chừa bộ nhớ cho hệ điều hành.
Mô hình này khớp với công việc đã chọn và nằm trong mức bộ nhớ an toàn mà bạn đã nhập.
ollama run gemma4:e2b-it-qatMô hình này khớp với công việc đã chọn và nằm trong mức bộ nhớ an toàn mà bạn đã nhập.
ollama run granite3.2:8bMô hình này khớp với công việc đã chọn và nằm trong mức bộ nhớ an toàn mà bạn đã nhập.
ollama run qwen3:8bMô hình này khớp với công việc đã chọn và nằm trong mức bộ nhớ an toàn mà bạn đã nhập.
ollama run gemma3:4bMô hình này khớp với công việc đã chọn và nằm trong mức bộ nhớ an toàn mà bạn đã nhập.
ollama run gemma4:e4b-it-qatLưu ý: Đây là ước tính để lập kế hoạch, không phải lời hứa về tốc độ. CPU, GPU, độ dài ngữ cảnh và phiên bản engine đều có thể thay đổi kết quả.
Công cụ so sánh kích thước tệp mô hình với RAM và bộ nhớ GPU. Nó chừa thêm bộ nhớ cho hệ điều hành và ngữ cảnh.
Một mô hình viết mã không luôn là lựa chọn tốt nhất cho hình ảnh hoặc tài liệu. LocalLens ưu tiên mô hình phù hợp với công việc bạn chọn.
Engine được chọn theo hệ điều hành, mức kinh nghiệm và cách bạn muốn sử dụng. Bạn vẫn có thể chọn engine khác.
Kết quả chưa được thử trên đúng thiết bị sẽ được ghi là ước tính. Điều này giúp bạn biết mức độ tin cậy trước khi cài đặt.
LocalLens giúp bạn thu hẹp danh sách mô hình AI có thể chạy trên máy của mình. Công cụ xem RAM, bộ nhớ GPU, loại công việc và cách bạn muốn cài đặt.
Không. Nhiều mô hình nhỏ có thể chạy bằng CPU và RAM. GPU rời thường làm phản hồi nhanh hơn, nhưng dung lượng RAM vẫn rất quan trọng.
Hãy bắt đầu với mô hình từ 1B đến 3B tham số ở dạng Q4. Đóng các ứng dụng nặng trước khi chạy. Mô hình 7B thường quá chật cho trải nghiệm ổn định trên máy 8 GB.
Mô hình 3B đến 8B dạng Q4 thường là điểm bắt đầu tốt. Qwen 3 4B, Gemma 3 4B và Qwen 2.5 Coder 7B là các lựa chọn đáng thử tùy công việc.
Ollama dễ dùng bằng lệnh ngắn. LM Studio có giao diện trực quan. llama.cpp cho phép điều chỉnh sâu và hỗ trợ nhiều thiết bị, nhưng cần kiến thức kỹ thuật hơn.
Không có công cụ nào có thể hứa chính xác tuyệt đối trước khi chạy thử trên đúng thiết bị. LocalLens dùng thông tin chính thức và mức bộ nhớ thận trọng. Bạn vẫn nên thử với công việc thật của mình.