ข้ามไปยังเนื้อหาหลัก
ตำแหน่งงานทั้งหมด

LLMOps Engineer

นำโมเดลภาษาขึ้นใช้งานจริง และดูแล serving, inference และ observability ของแพลตฟอร์ม AI

  • แผนก: Engineering
  • สถานที่ทำงาน: กรุงเทพฯ
  • งานประจำ

เกี่ยวกับตำแหน่ง

คุณจะนำโมเดลภาษาของลูกค้าขึ้นใช้งานจริงบน GPU ของเราหรือของลูกค้า ออกแบบ serving stack ให้เร็ว เสถียร และคุมต้นทุนได้ แล้วดูแลต่อหลังขึ้นระบบ

หน้าที่และความรับผิดชอบ

  • Deploy โมเดล open-weight บน vLLM, TensorRT-LLM หรือ Triton
  • ปรับ batching, quantization และ caching ให้ได้ latency และ throughput ตามเป้า
  • สร้าง pipeline สำหรับ RAG, evaluation และการปล่อยโมเดลเวอร์ชันใหม่
  • ตั้ง API gateway พร้อม authentication, rate limit และ usage tracking
  • วาง observability ครอบคลุม latency, error, token usage และต้นทุนต่อ request
  • วาง capacity ร่วมกับทีม GPU Infrastructure

คุณสมบัติ

  • ประสบการณ์ DevOps, platform หรือ MLOps 3 ปีขึ้นไป
  • ใช้ Kubernetes, Helm และ container ได้คล่อง
  • เขียน Python ได้ดีและอ่านโค้ดของ inference server ได้
  • เคย deploy LLM หรือโมเดล deep learning ขึ้น production
  • ใช้ Prometheus, Grafana หรือ OpenTelemetry ได้

คุณสมบัติที่เป็นข้อได้เปรียบ

  • เข้าใจ KV cache, speculative decoding หรือ tensor parallelism
  • เคยใช้ vector database เช่น Milvus, Qdrant หรือ pgvector
  • มีผลงาน open source ด้าน LLM tooling

เครื่องมือที่ใช้

  • Kubernetes
  • Helm
  • vLLM
  • TensorRT-LLM
  • Triton
  • Python
  • Prometheus
  • OpenTelemetry

ทำงานกับ Zotect

  • ทำงานครบทั้ง stack ของ AI ตั้งแต่ data center, network และ GPU ไปจนถึง model serving
  • งานของคุณขึ้น production จริงให้ลูกค้าในไทย สิงคโปร์ และสหรัฐอเมริกา
  • ทำงานใกล้ชิดกับ CEO ในทีมที่นำด้วยวิศวกรรม
  • สำนักงานอยู่ที่อาคารเกษร ถนนเพลินจิต ใกล้ BTS ชิดลม

How to apply

ส่ง CV และลิงก์ผลงาน (ถ้ามี) มาที่ hr@zotect.com โดยระบุชื่อตำแหน่งในหัวอีเมล

ส่งเฉพาะข้อมูลที่ใช้พิจารณาการสมัครงาน ไม่ต้องแนบเลขบัตรประชาชน ศาสนา หรือข้อมูลสุขภาพ อ่านเพิ่มเติมใน นโยบายความเป็นส่วนตัว