LLMOps Engineer
นำโมเดลภาษาขึ้นใช้งานจริง และดูแล serving, inference และ observability ของแพลตฟอร์ม AI
เกี่ยวกับตำแหน่ง
คุณจะนำโมเดลภาษาของลูกค้าขึ้นใช้งานจริงบน GPU ของเราหรือของลูกค้า ออกแบบ serving stack ให้เร็ว เสถียร และคุมต้นทุนได้ แล้วดูแลต่อหลังขึ้นระบบ
หน้าที่และความรับผิดชอบ
- Deploy โมเดล open-weight บน vLLM, TensorRT-LLM หรือ Triton
- ปรับ batching, quantization และ caching ให้ได้ latency และ throughput ตามเป้า
- สร้าง pipeline สำหรับ RAG, evaluation และการปล่อยโมเดลเวอร์ชันใหม่
- ตั้ง API gateway พร้อม authentication, rate limit และ usage tracking
- วาง observability ครอบคลุม latency, error, token usage และต้นทุนต่อ request
- วาง capacity ร่วมกับทีม GPU Infrastructure
คุณสมบัติ
- ประสบการณ์ DevOps, platform หรือ MLOps 3 ปีขึ้นไป
- ใช้ Kubernetes, Helm และ container ได้คล่อง
- เขียน Python ได้ดีและอ่านโค้ดของ inference server ได้
- เคย deploy LLM หรือโมเดล deep learning ขึ้น production
- ใช้ Prometheus, Grafana หรือ OpenTelemetry ได้
คุณสมบัติที่เป็นข้อได้เปรียบ
- เข้าใจ KV cache, speculative decoding หรือ tensor parallelism
- เคยใช้ vector database เช่น Milvus, Qdrant หรือ pgvector
- มีผลงาน open source ด้าน LLM tooling
เครื่องมือที่ใช้
- Kubernetes
- Helm
- vLLM
- TensorRT-LLM
- Triton
- Python
- Prometheus
- OpenTelemetry
ทำงานกับ Zotect
- ทำงานครบทั้ง stack ของ AI ตั้งแต่ data center, network และ GPU ไปจนถึง model serving
- งานของคุณขึ้น production จริงให้ลูกค้าในไทย สิงคโปร์ และสหรัฐอเมริกา
- ทำงานใกล้ชิดกับ CEO ในทีมที่นำด้วยวิศวกรรม
- สำนักงานอยู่ที่อาคารเกษร ถนนเพลินจิต ใกล้ BTS ชิดลม
How to apply
ส่ง CV และลิงก์ผลงาน (ถ้ามี) มาที่ hr@zotect.com โดยระบุชื่อตำแหน่งในหัวอีเมล
ส่งเฉพาะข้อมูลที่ใช้พิจารณาการสมัครงาน ไม่ต้องแนบเลขบัตรประชาชน ศาสนา หรือข้อมูลสุขภาพ อ่านเพิ่มเติมใน นโยบายความเป็นส่วนตัว
