GPU Infrastructure Engineer
ออกแบบ ติดตั้ง และดูแล GPU cluster ที่ลูกค้าใช้เทรนและรันโมเดลจริง
เกี่ยวกับตำแหน่ง
คุณจะรับผิดชอบ GPU cluster ของลูกค้าตั้งแต่วันติดตั้งจนถึงวันที่ใช้งานจริง ทำงานร่วมกับทีม network และ LLMOps ให้ cluster พร้อมสำหรับการเทรนและ inference งานมีทั้งหน้างาน data center และการดูแลระบบระยะยาว
หน้าที่และความรับผิดชอบ
- ติดตั้งและตั้งค่า GPU server บน NVIDIA HGX ตาม NVIDIA Reference Architecture
- ทำ validation และ benchmark ก่อนส่งมอบ ทั้ง burn-in, NCCL test และ storage throughput
- ติดตั้งและดูแล Slurm หรือ Kubernetes สำหรับงาน GPU
- วาง monitoring สำหรับ GPU utilization อุณหภูมิ และ error ของ hardware
- แก้ปัญหา driver, firmware และ hardware ร่วมกับผู้ผลิต
- เขียนเอกสารส่งมอบและ runbook ให้ทีม operation
คุณสมบัติ
- ประสบการณ์ดูแล Linux server หรือ HPC cluster 3 ปีขึ้นไป
- ใช้ NVIDIA driver, CUDA และ DCGM ได้จริง
- เขียน automation ด้วย Bash, Python หรือ Ansible ได้
- เข้าใจพื้นฐาน network และ storage ใน data center
- เดินทางไปหน้างาน data center ในประเทศไทยได้
คุณสมบัติที่เป็นข้อได้เปรียบ
- เคยใช้ InfiniBand หรือ RoCE กับ GPU cluster
- เคยใช้ NVIDIA GPU Operator บน Kubernetes
- มีใบรับรองของ NVIDIA, Red Hat หรือ Linux Foundation
เครื่องมือที่ใช้
- Linux
- NVIDIA HGX
- CUDA
- DCGM
- Slurm
- Kubernetes
- Ansible
- Prometheus
ทำงานกับ Zotect
- ทำงานครบทั้ง stack ของ AI ตั้งแต่ data center, network และ GPU ไปจนถึง model serving
- งานของคุณขึ้น production จริงให้ลูกค้าในไทย สิงคโปร์ และสหรัฐอเมริกา
- ทำงานใกล้ชิดกับ CEO ในทีมที่นำด้วยวิศวกรรม
- สำนักงานอยู่ที่อาคารเกษร ถนนเพลินจิต ใกล้ BTS ชิดลม
How to apply
ส่ง CV และลิงก์ผลงาน (ถ้ามี) มาที่ hr@zotect.com โดยระบุชื่อตำแหน่งในหัวอีเมล
ส่งเฉพาะข้อมูลที่ใช้พิจารณาการสมัครงาน ไม่ต้องแนบเลขบัตรประชาชน ศาสนา หรือข้อมูลสุขภาพ อ่านเพิ่มเติมใน นโยบายความเป็นส่วนตัว
