미리디 · 데이터·AI
- 디자인 제작 플랫폼
[미리캔버스] Machine Learning Engineer (Model Inference & Serving)
이 브라우저에 저장돼요 · 최근 확인
무슨 일을 하고, 무엇을 요구하나요?
데이터·AI · 공고 표기 · 경력 1~3년
- 자격 요건
- vLLM 기반 배치 추론 및 OpenAI 호환 API 서빙을 운영합니다.
- TensorRT-LLM 기반으로 latency에 민감한 내부 서비스용 LLM 서빙을 구성하고 튜닝합니다.
- 모델 교체, 버전 롤아웃, 용량 산정, 트래픽 급증 대응을 담당합니다.
- PyTorch 모델을 가속 프레임워크로 변환하고, 변환 전후의 정확도와 추론 속도를 측정해 검증합니다.
- 우대 사항
- Python 웹 프레임워크(FastAPI, Django, Flask) 중 하나로 프로덕션 서비스를 개발하고 운영해본 경험이 있으신 분
- 모델 경량화(quantization, pruning, distillation) 및 학습 코드 작성 경험이 있으신 분
- 다양한 GPU(H200, A100, A10G, L40S 등) 아키텍처에서 추론 가속 경험이 있으신 분
- CUDA 이해 및 프로파일링 도구(Nsight Systems, PyTorch Profiler 등) 활용 경험이 있으신 분
공고 원문의 문장을 그대로 옮겼어요. 근무 조건과 전형은 바뀔 수 있으니 지원 전에 원문을 확인하세요.
그 밖의 경력 조건
- 필수·우대 미확인1~3년
미리디, 어떤 회사일까요?
- 디자인 제작 플랫폼
미리디는 미리캔버스 등 디자인 서비스를 통해 전문가와 비전문가의 시각적 소통을 돕는 기업이에요.
미리디 더 알아보기포지션 소개 · 공고 전문 읽기
| 직무 소개
미리캔버스는 "디자인을 더 쉽고, 똑똑하게 완성하는 세상"을 목표로 합니다.
AI 팀은 검색 임베딩 모델, 자체 LLM, 외부 LLM 연동을 포함한 다수의 AI 모델을 실제 서비스에서 운영하고 있습니다. 사용자가 검색창에 한 문장을 입력하는 순간, 여러 모델이 GPU 위에서 동시에 추론되고 그 결과가 수십 밀리초 안에 돌아와야 합니다.
이 포지션은 만들어진 모델을 프로덕션에서 가장 빠르게 돌리는 자리입니다. 모델 추론(inference) 성능을 끌어올려 사용자 경험과 비용을 동시에 개선합니다.
현재 미리캔버스의 템플릿·요소 검색, 내용 시각화, 추천 등 사용자가 매일 쓰는 기능 뒤에서 자체 모델이 동작하고 있습니다. 이 모델들이 실제 사용자에게 닿는 마지막 구간 전체를 다루게 됩니다.
미리캔버스의 모델을 수많은 사용자의 경험으로 바꾸는 일에 함께할 동료를 찾습니다.
| 기대 모습
[1개월 뒤]
- 미리캔버스의 AI 서비스 구조와 현재 추론 아키텍처(TensorRT, vLLM, TensorRT-LLM 기반 서빙 구성)를 파악합니다.
- 운영 중인 모델 목록, 각 모델의 트래픽 패턴, latency 요구사항, GPU 할당 현황을 정리합니다.
- 온콜 및 장애 대응 프로세스에 참여하며 실제 운영 흐름을 익힙니다.
[3개월 뒤]
- 주요 모델 중 하나를 선정해 추론 최적화를 처음부터 끝까지 수행하고, latency와 GPU 비용 개선 수치를 확인합니다.
- 추론 성능 지표(p99 latency, GPU 활용률, 토큰 처리량)를 상시 관측 가능한 대시보드와 알림으로 만듭니다.
- 서빙 요청 접수부터 배포까지의 표준 경로를 정의하고, 반복 작업을 자동화합니다.
[그 이후]
- 각 서비스 팀이 직접 모델을 배포할 수 있는 서빙 플랫폼을 구축합니다.
- 모델 특성에 맞는 GPU를 선정하고 배치해 전체 추론 비용을 지속적으로 낮춥니다.
- 신규 추론 최적화 기술(양자화, 스펙큘레이티브 디코딩, 디스틸레이션 등)을 검증하고 서비스에 도입합니다.
- 팀 내 기술 전파, 문서화, 온콜 체계 정착을 통해 서빙 역량을 조직 자산으로 만듭니다.
| 주요 업무
"미리디에서 이런 일들을 함께 하고 싶어요"
✅LLM 서빙 운영 및 고도화
- vLLM 기반 배치 추론 및 OpenAI 호환 API 서빙을 운영합니다.
- TensorRT-LLM 기반으로 latency에 민감한 내부 서비스용 LLM 서빙을 구성하고 튜닝합니다.
- 모델 교체, 버전 롤아웃, 용량 산정, 트래픽 급증 대응을 담당합니다.
✅모델 경량화 및 추론 최적화
- PyTorch 모델을 가속 프레임워크로 변환하고, 변환 전후의 정확도와 추론 속도를 측정해 검증합니다.
- quantization, pruning, distillation으로 모델 자체를 줄여 추론 비용과 latency를 낮춥니다.
- 프로파일링을 통해 실제 병목이 되는 연산을 식별하고 개선합니다.
✅추론 신뢰성 · 모니터링
- p99 latency, GPU 활용률, 토큰 처리량, 큐 대기 시간 등 핵심 지표를 수집하고 대시보드화합니다.
- 성능 저하를 사용자 리포트 이전에 선제 탐지하는 알림 체계를 구축합니다.
- 서비스별 latency와 비용 요구사항에 맞춰 모델을 어떤 GPU에 올릴지 결정합니다.
| 자격요건
"이런 분이라면 목표 달성에 확신을 얻을 것 같아요"
- 추론 최적화 프레임워크(TensorRT, TensorRT-LLM, vLLM, ONNX Runtime 등) 중 하나 이상으로 모델을 프로덕션에 서빙해본 경험이 있으신 분
- GPU 추론 경험이 있고, 배치 크기 · GPU 메모리 · throughput · latency 사이의 트레이드오프를 설명할 수 있으신 분
- 추론에 사용되는 주요 연산(matmul, softmax/sigmoid, cumsum, attention 등)이 어디에서 병목이 되는지 이해하고 계신 분
- 리눅스 서버와 컨테이너 환경에서 프로세스, 메모리, 네트워크, 로그를 스스로 추적해 문제를 좁혀갈 수 있으신 분
| 우대 사항
"이런 분이라면 장기적으로 서로에게 더 긍정적일 것 같아요!"
- Python 웹 프레임워크(FastAPI, Django, Flask) 중 하나로 프로덕션 서비스를 개발하고 운영해본 경험이 있으신 분
- 모델 경량화(quantization, pruning, distillation) 및 학습 코드 작성 경험이 있으신 분
- 다양한 GPU(H200, A100, A10G, L40S 등) 아키텍처에서 추론 가속 경험이 있으신 분
- CUDA 이해 및 프로파일링 도구(Nsight Systems, PyTorch Profiler 등) 활용 경험이 있으신 분
- 검색, 추천 등 대규모 실시간 트래픽 시스템의 서빙 경험이 있으신 분
| 이런 분과 함께하고 싶습니다
- 모델의 정확도뿐 아니라, 그 모델이 실제로 몇 ms에 얼마의 비용으로 도는지에 관심이 있는 분
- 추측 대신 프로파일링과 측정으로 병목을 찾는 것을 선호하는 분
- 장애를 개인의 실수가 아니라 시스템의 개선점으로 다루는 분
| 기타 사항
- [서류 전형] - [1차 인터뷰] - [처우 협의] - [입사] 의 프로세스로 진행됩니다.
- 서류는 원활한 검토를 위해 PDF 형식으로 제출 부탁 드립니다.
- 직무/직급에 따라 2차 인터뷰가 추가될 수 있습니다.
- 직급에 따라 인터뷰 후 레퍼런스 체크 전형이 추가될 수 있습니다.
- 입사 후 3개월의 수습 기간 및 수습 평가가 진행됩니다. (급여 100%)
- 서류 전형 결과 안내까지는 최대 2주, 인터뷰 결과 안내까지는 최대 3주가 소요됩니다.
- 여러 포지션에 동시에 지원해주시는 것은 가능하지만 동일한 포지션의 경우 최종 결과 안내를 받은 시점으로부터 6개월 후에 재지원이 가능합니다.