เกี่ยวกับตำแหน่งนี้
นี่คือการแสดงความสนใจ (Expression of Interest) ไม่ใช่ตำแหน่งงานที่เปิดรับสมัครในขณะนี้
เราดูแลคลัสเตอร์ GPU บนฮาร์ดแวร์ระดับ AMD Instinct และ Nvidia HGX งานด้านวิศวกรรมระบบครอบคลุมตั้งแต่เฟิร์มแวร์และสแต็ก ROCm หรือ CUDA ไปจนถึง fabric, optics, RDMA และพื้นที่จัดเก็บข้อมูล จนถึงคลัสเตอร์ที่พร้อมให้ tenant ใช้งาน
หากคุณเคยสร้างหรือดูแลระบบ GPU ระดับโปรดักชันในสเกลที่มีนัยสำคัญ เราอยากรู้จักคุณ
ความรับผิดชอบ
- ติดตั้งคลัสเตอร์ GPU ใหม่ ได้แก่ เฟิร์มแวร์ BIOS ไดรเวอร์สแต็ก การตั้งค่า fabric และการตรวจสอบความถูกต้อง
- ปรับแต่งและแก้ไขปัญหาพฤติกรรมของ RDMA, RoCE และ NCCL หรือ RCCL ในระดับคลัสเตอร์
- ดูแลการทำงานของ ROCm, CUDA และไลบรารีสนับสนุนต่างๆ ในทุก tenant
- ประสานงานกับทีมแพลตฟอร์ม เครือข่าย และดาต้าเซ็นเตอร์ เรื่องความจุ ความน่าเชื่อถือ และการเปลี่ยนฮาร์ดแวร์
- เขียนรันบุ๊กที่ผู้ดูแลระบบคนถัดไปจะต้องใช้อ้างอิง
ทักษะและประสบการณ์ที่จำเป็น
- มีประสบการณ์ตรงกับคลัสเตอร์ GPU ระดับโปรดักชัน ทั้ง AMD Instinct หรือ Nvidia HGX
- พื้นฐาน Linux ที่แข็งแกร่ง สามารถแก้ไขปัญหาระดับเคอร์เนลและไดรเวอร์ได้
- เข้าใจการออกแบบ fabric สำหรับ RDMA การปรับแต่ง NCCL หรือ RCCL และประสิทธิภาพการฝึกโมเดลแบบหลายโหนด
- คุ้นเคยกับการอัปเดตเฟิร์มแวร์ การวินิจฉัยฮาร์ดแวร์ และการประสานงานกับผู้ผลิต
- ทำงานอย่างเป็นระบบ มุ่งหาสาเหตุที่แท้จริงมากกว่าการเปลี่ยนชิ้นส่วนไปเรื่อยๆ
เกี่ยวกับ OneQode
OneQode คือผู้ให้บริการโครงสร้างพื้นฐานดิจิทัลประสิทธิภาพสูงระดับโลก ด้วยแพลตฟอร์มที่ผสานรวมตั้งแต่ต้นจนจบ ครอบคลุมระบบประมวลผลคลาวด์ เครือข่ายเลเทนซีต่ำ และเทคโนโลยีอธิปไตยในดาต้าเซ็นเตอร์กว่า 30 แห่งใน 5 ทวีป พวกเขาช่วยให้องค์กร ภาครัฐ และธุรกิจที่ต้องการประสิทธิภาพสูงสามารถรันเวิร์กโหลด AI และเวิร์กโหลดสำคัญได้ในระดับขยายตัวทั่วโลก
วิธีสมัคร
หากนี่ฟังดูเหมาะกับคุณ เราอยากได้ยินจากคุณ
คลิกปุ่มด้านล่างเพื่อสมัคร