Member of Technical Staff, Inference
Full-time · Senior Level · Anywhere
Thông tin công việc
- Hình thức: Làm việc từ xa (remote)
- Mức lương: Thỏa thuận
- Ngành: Product
- Chuyên môn: Software Engineering
- Cấp bậc: Senior Level
- Khu vực tuyển: Anywhere
- Ngày đăng: 27/09/2026
Mô tả công việc
Vị trí này tập trung vào việc tối ưu hóa engine inference cho các mô hình LLM và diffusion, làm việc trực tiếp ở phần lõi của vLLM để cải thiện cách mô hình thực thi trên nhiều loại phần cứng và kiến trúc khác nhau. Ứng viên cần có hiểu biết sâu về kiến trúc transformer, kỹ năng Python và PyTorch, cùng kinh nghiệm với các hệ thống inference như vLLM, TensorRT-LLM, SGLang hay TGI, đồng thời có khả năng đọc và triển khai các kỹ thuật từ bài báo nghiên cứu. Phù hợp nhất với kỹ sư hệ thống/học máy cấp cao, yêu thích làm việc trong mã nguồn mở và muốn tạo ảnh hưởng trực tiếp đến cách thế giới vận hành AI inference.