InferCap
Toolkit kiểm tra khả năng chạy LLM trên phần cứng hiện có, tạo cấu hình vLLM và đo capacity của hệ thống inference.
Bài toán
Triển khai LLM thường bắt đầu bằng nhiều câu hỏi: model có vừa GPU không, cấu hình serving nào hợp lý và GPU đạt giới hạn ở đâu?
Cách tiếp cận
InferCap kết hợp kiểm tra môi trường và GPU, tìm model theo family, ước lượng memory, xác minh endpoint, benchmark và telemetry trong một quy trình CLI.
Tài liệu có sẵn
Repository công khai gồm Python CLI, tests, tài liệu, output benchmark JSON / PNG và giao diện web để khám phá công cụ.
Đóng góp & Bối cảnh
Tự thiết kế và xây dựng dự án như một toolkit mã nguồn mở.
Phạm vi & Giới hạn dự án
Phiên bản hiện tại tập trung vào NVIDIA GPU và vLLM. Ước lượng memory chỉ dùng để kiểm tra tính khả thi, không bảo đảm runtime ổn định.