ข้ามไปยังเนื้อหาหลัก
ตำแหน่งงานทั้งหมด

GPU Infrastructure Engineer

ออกแบบ ติดตั้ง และดูแล GPU cluster ที่ลูกค้าใช้เทรนและรันโมเดลจริง

  • แผนก: Engineering
  • สถานที่ทำงาน: กรุงเทพฯ
  • งานประจำ

เกี่ยวกับตำแหน่ง

คุณจะรับผิดชอบ GPU cluster ของลูกค้าตั้งแต่วันติดตั้งจนถึงวันที่ใช้งานจริง ทำงานร่วมกับทีม network และ LLMOps ให้ cluster พร้อมสำหรับการเทรนและ inference งานมีทั้งหน้างาน data center และการดูแลระบบระยะยาว

หน้าที่และความรับผิดชอบ

  • ติดตั้งและตั้งค่า GPU server บน NVIDIA HGX ตาม NVIDIA Reference Architecture
  • ทำ validation และ benchmark ก่อนส่งมอบ ทั้ง burn-in, NCCL test และ storage throughput
  • ติดตั้งและดูแล Slurm หรือ Kubernetes สำหรับงาน GPU
  • วาง monitoring สำหรับ GPU utilization อุณหภูมิ และ error ของ hardware
  • แก้ปัญหา driver, firmware และ hardware ร่วมกับผู้ผลิต
  • เขียนเอกสารส่งมอบและ runbook ให้ทีม operation

คุณสมบัติ

  • ประสบการณ์ดูแล Linux server หรือ HPC cluster 3 ปีขึ้นไป
  • ใช้ NVIDIA driver, CUDA และ DCGM ได้จริง
  • เขียน automation ด้วย Bash, Python หรือ Ansible ได้
  • เข้าใจพื้นฐาน network และ storage ใน data center
  • เดินทางไปหน้างาน data center ในประเทศไทยได้

คุณสมบัติที่เป็นข้อได้เปรียบ

  • เคยใช้ InfiniBand หรือ RoCE กับ GPU cluster
  • เคยใช้ NVIDIA GPU Operator บน Kubernetes
  • มีใบรับรองของ NVIDIA, Red Hat หรือ Linux Foundation

เครื่องมือที่ใช้

  • Linux
  • NVIDIA HGX
  • CUDA
  • DCGM
  • Slurm
  • Kubernetes
  • Ansible
  • Prometheus

ทำงานกับ Zotect

  • ทำงานครบทั้ง stack ของ AI ตั้งแต่ data center, network และ GPU ไปจนถึง model serving
  • งานของคุณขึ้น production จริงให้ลูกค้าในไทย สิงคโปร์ และสหรัฐอเมริกา
  • ทำงานใกล้ชิดกับ CEO ในทีมที่นำด้วยวิศวกรรม
  • สำนักงานอยู่ที่อาคารเกษร ถนนเพลินจิต ใกล้ BTS ชิดลม

How to apply

ส่ง CV และลิงก์ผลงาน (ถ้ามี) มาที่ hr@zotect.com โดยระบุชื่อตำแหน่งในหัวอีเมล

ส่งเฉพาะข้อมูลที่ใช้พิจารณาการสมัครงาน ไม่ต้องแนบเลขบัตรประชาชน ศาสนา หรือข้อมูลสุขภาพ อ่านเพิ่มเติมใน นโยบายความเป็นส่วนตัว