2x là con số khiến mình chú ý đầu tiên, anh em ạ, nhưng mình chưa tự chạy thử; mình chỉ đọc tài liệu và thảo luận của người dùng về Magnitude.
Kết luận ngắn là công cụ này đáng để anh em thử nếu đang chạy model local cho agent trên máy cá nhân. Anh em cần độ ổn định cao, nhiều GPU khác loại hoặc context rất dài thì nên chờ thêm phản hồi.
Magnitude là gì và khác engine cũ ra sao
Nó là một inference engine mã nguồn mở dành cho agent. Inference engine là phần nhận model và prompt rồi tạo token trả về, còn agent là công cụ biết đọc file, chạy lệnh hoặc gọi tool để hoàn thành việc.
Điểm khác nằm ở kernel. Kernel là đoạn code thực hiện phép tính trên CPU hoặc GPU. Các engine phổ biến thường dùng kernel đã biên dịch sẵn cho nhóm phần cứng rộng, còn công cụ này biên dịch và chỉnh kernel ngay trên máy trước khi model chạy.
Tài liệu ghi model mã nguồn mở có thể chạy nhanh hơn llama.cpp tới 2x. Repo cũng ghi tốc độ decode cao hơn 92% trên Metal và 19% trên CUDA, nhưng đây là con số do nhà phát triển công bố, chưa phải kết quả mình tự đo.
Cách làm này có lý về mặt kỹ thuật. Một model chạy trên hai máy có thể cần cách sắp xếp kernel khác nhau, nên việc chỉnh theo chip thật có thể giảm phần tính toán dư.
Mình chưa xem benchmark đó là kết luận chung cho mọi máy. Một bình luận viên cũng hỏi cách cấu hình llama.cpp khi đo, vì tốc độ của nó thay đổi khá nhiều theo thiết lập.
Điểm mạnh theo tài liệu
Công cụ này hỗ trợ Apple Silicon, NVIDIA, AMD và cả máy chỉ có CPU. Tài liệu không đặt mức phần cứng tối thiểu cố định, nên máy ít memory sẽ chạy model nhỏ hơn còn máy nhiều memory có thể chạy model lớn hơn.
Tài liệu còn ghi mỗi agent dùng ít hơn 27% memory và phần memory đó được giải phóng khi agent dừng. Anh em vẫn cần kiểm tra theo model và context window mình dùng, vì nguồn chưa cho thấy con số này áp dụng giống nhau cho mọi máy.
Công cụ này cũng hỗ trợ nhiều phiên chạy cùng lúc. Các phiên dùng chung prefix cache để tránh chậm đi khi nhiều agent dùng chung phần prompt mở đầu.
Cách kết nối khá gọn. Repo ghi app có thể nối một lần với Pi, OpenCode, Hermes và Codex, còn agent khác có thể gọi qua API tương thích với OpenAI.
Desktop app đã có sẵn CLI, tức công cụ gõ lệnh đi kèm app. Anh em không cần cài thêm một package riêng để dùng CLI.
Về riêng tư, tài liệu ghi prompt, file và model nằm trên máy. Sau khi tải model xong, app không cần internet để chạy, hợp với anh em xử lý code nội bộ hoặc tài liệu khách hàng.
Điểm yếu và lời phàn nàn
Vấn đề lớn nhất nằm ở khoảng cách giữa benchmark của nhà phát triển và trải nghiệm của người dùng. Một bình luận viên muốn thấy kết quả so với MLX, vì họ cho rằng tốc độ của llama.cpp phụ thuộc khá nhiều vào cách cấu hình.
Một người dùng nói app nhận sai số GPU trên máy của họ và chỉ chạy trên một GPU. Người này cũng nói llama.cpp nhanh hơn ở tốc độ decode trong cấu hình riêng của họ, nhưng đây là ý kiến cá nhân chứ chưa phải kết luận chung.
Khâu đánh giá model cũng bị phàn nàn. Một người nói màn hình “Assessing Models” chạy quá lâu, khiến họ chưa tải được model đầu tiên, và muốn app đánh giá ngầm hoặc chỉ đánh giá khi người dùng chọn model.
Các bình luận khác hỏi về máy AMD tùy biến, việc chia model qua nhiều thiết bị, model có context dài và cách xếp hạng model trên hệ thống gồm nhiều loại máy. Nguồn chưa có câu trả lời đủ rõ cho các trường hợp này.
Mình thấy các phàn nàn chạm đúng phần khó của local inference. Tốc độ decode một lượt chưa đủ nói agent chạy nhanh, vì agent còn phải gọi tool, đọc file, giữ KV cache và xử lý nhiều phiên cùng lúc.
Một bình luận viên còn cho biết llama.cpp nhanh hơn trong cấu hình của họ, trong khi một người khác bị kẹt ở bước đánh giá model. Hai ý kiến này chưa đủ phủ nhận cách làm của công cụ, nhưng đủ để anh em đừng coi con số trên trang giới thiệu là tốc độ chắc chắn trên máy mình.
Giá và cách truy cập
Repo giới thiệu công cụ là miễn phí, riêng tư và mã nguồn mở. Tài liệu ghi app không tính token cost, dữ liệu không rời máy và code dùng giấy phép Apache 2.0.
Anh em tải app, cài rồi mở desktop app. Sau đó anh em chọn model trong mục Discover, tải model, mở Connections và nối agent đang dùng.
App hỗ trợ macOS, Windows và Linux. CLI đã nằm trong desktop app, nên anh em không phải cài CLI riêng.
Công cụ này không biến một máy ít memory thành máy chạy được mọi model. Máy nhỏ vẫn phải dùng model nhỏ hơn, còn model lớn vẫn cần đủ memory để chạy.
Điểm tiện là app có thể chạy trên CPU nếu anh em không có GPU phù hợp. Điểm cần nhớ là model nhỏ hay model lớn vẫn phụ thuộc vào memory thật trên máy, không phụ thuộc riêng vào tên engine.
Ai nên thử và ai nên chờ
Anh em nên thử nếu đang dùng agent code trên Apple Silicon, NVIDIA, AMD hoặc CPU. Một project nhỏ sẽ giúp anh em đo đúng tốc độ decode, thời gian gọi tool và mức memory trong workflow của mình.
Founder làm công cụ nội bộ cũng có lý do để xem qua. API tương thích với OpenAI có thể giúp hệ thống hiện tại gọi engine mà không phải đổi toàn bộ agent, dù repo chưa cam kết mọi model và workflow đều tương thích giống nhau.
Anh em nên chờ nếu đang cần chạy nhiều GPU khác loại, chia model qua nhiều máy hoặc giữ context rất dài trong nhiều agent cùng lúc. Các trường hợp này xuất hiện trong thảo luận, còn tài liệu chưa có đủ benchmark để mình kết luận.
Mình chưa xem đây là lựa chọn mặc định thay cho llama.cpp. Ý tưởng kỹ thuật rõ, cách cài dễ, nhưng phản hồi hiện tại cho thấy lỗi nhận GPU, tốc độ thấp hơn trên một số máy và bước đánh giá model còn gây cản trở.
Anh em cứ thử trên project nhỏ trước, vì benchmark đáng tin nhất là lúc agent phải làm xong việc thật chứ không phải lúc một con số đẹp đứng riêng trên trang giới thiệu.



