← 공고 목록으로

미리디 · 데이터·AI

  • 디자인 제작 플랫폼

[미리캔버스] Machine Learning Engineer (Model Inference & Serving)

대한민국 서울특별시 구로구 디지털로31길 12 · 8층 미리디공식 채용 공고

Python

이 브라우저에 저장돼요 · 최근 확인

무슨 일을 하고, 무엇을 요구하나요?

데이터·AI · 공고 표기 · 경력 1~3년

자격 요건
  • vLLM 기반 배치 추론 및 OpenAI 호환 API 서빙을 운영합니다.
  • TensorRT-LLM 기반으로 latency에 민감한 내부 서비스용 LLM 서빙을 구성하고 튜닝합니다.
  • 모델 교체, 버전 롤아웃, 용량 산정, 트래픽 급증 대응을 담당합니다.
  • PyTorch 모델을 가속 프레임워크로 변환하고, 변환 전후의 정확도와 추론 속도를 측정해 검증합니다.
자격 요건 12개 더 보기
우대 사항
  • Python 웹 프레임워크(FastAPI, Django, Flask) 중 하나로 프로덕션 서비스를 개발하고 운영해본 경험이 있으신 분
  • 모델 경량화(quantization, pruning, distillation) 및 학습 코드 작성 경험이 있으신 분
  • 다양한 GPU(H200, A100, A10G, L40S 등) 아키텍처에서 추론 가속 경험이 있으신 분
  • CUDA 이해 및 프로파일링 도구(Nsight Systems, PyTorch Profiler 등) 활용 경험이 있으신 분
우대 사항 1개 더 보기

공고 원문의 문장을 그대로 옮겼어요. 근무 조건과 전형은 바뀔 수 있으니 지원 전에 원문을 확인하세요.

그 밖의 경력 조건

  • 필수·우대 미확인1~3년

미리디, 어떤 회사일까요?

  • 디자인 제작 플랫폼

미리디는 미리캔버스 등 디자인 서비스를 통해 전문가와 비전문가의 시각적 소통을 돕는 기업이에요.

미리디 더 알아보기
포지션 소개 · 공고 전문 읽기

| 직무 소개

미리캔버스는 "디자인을 더 쉽고, 똑똑하게 완성하는 세상"을 목표로 합니다.

AI 팀은 검색 임베딩 모델, 자체 LLM, 외부 LLM 연동을 포함한 다수의 AI 모델을 실제 서비스에서 운영하고 있습니다. 사용자가 검색창에 한 문장을 입력하는 순간, 여러 모델이 GPU 위에서 동시에 추론되고 그 결과가 수십 밀리초 안에 돌아와야 합니다.

이 포지션은 만들어진 모델을 프로덕션에서 가장 빠르게 돌리는 자리입니다. 모델 추론(inference) 성능을 끌어올려 사용자 경험과 비용을 동시에 개선합니다.

현재 미리캔버스의 템플릿·요소 검색, 내용 시각화, 추천 등 사용자가 매일 쓰는 기능 뒤에서 자체 모델이 동작하고 있습니다. 이 모델들이 실제 사용자에게 닿는 마지막 구간 전체를 다루게 됩니다.

미리캔버스의 모델을 수많은 사용자의 경험으로 바꾸는 일에 함께할 동료를 찾습니다.

| 기대 모습

[1개월 뒤]

  • 미리캔버스의 AI 서비스 구조와 현재 추론 아키텍처(TensorRT, vLLM, TensorRT-LLM 기반 서빙 구성)를 파악합니다.
  • 운영 중인 모델 목록, 각 모델의 트래픽 패턴, latency 요구사항, GPU 할당 현황을 정리합니다.
  • 온콜 및 장애 대응 프로세스에 참여하며 실제 운영 흐름을 익힙니다.

[3개월 뒤]

  • 주요 모델 중 하나를 선정해 추론 최적화를 처음부터 끝까지 수행하고, latency와 GPU 비용 개선 수치를 확인합니다.
  • 추론 성능 지표(p99 latency, GPU 활용률, 토큰 처리량)를 상시 관측 가능한 대시보드와 알림으로 만듭니다.
  • 서빙 요청 접수부터 배포까지의 표준 경로를 정의하고, 반복 작업을 자동화합니다.

[그 이후]

  • 각 서비스 팀이 직접 모델을 배포할 수 있는 서빙 플랫폼을 구축합니다.
  • 모델 특성에 맞는 GPU를 선정하고 배치해 전체 추론 비용을 지속적으로 낮춥니다.
  • 신규 추론 최적화 기술(양자화, 스펙큘레이티브 디코딩, 디스틸레이션 등)을 검증하고 서비스에 도입합니다.
  • 팀 내 기술 전파, 문서화, 온콜 체계 정착을 통해 서빙 역량을 조직 자산으로 만듭니다.

| 주요 업무

"미리디에서 이런 일들을 함께 하고 싶어요"

✅LLM 서빙 운영 및 고도화

  • vLLM 기반 배치 추론 및 OpenAI 호환 API 서빙을 운영합니다.
  • TensorRT-LLM 기반으로 latency에 민감한 내부 서비스용 LLM 서빙을 구성하고 튜닝합니다.
  • 모델 교체, 버전 롤아웃, 용량 산정, 트래픽 급증 대응을 담당합니다.

✅모델 경량화 및 추론 최적화

  • PyTorch 모델을 가속 프레임워크로 변환하고, 변환 전후의 정확도와 추론 속도를 측정해 검증합니다.
  • quantization, pruning, distillation으로 모델 자체를 줄여 추론 비용과 latency를 낮춥니다.
  • 프로파일링을 통해 실제 병목이 되는 연산을 식별하고 개선합니다.

✅추론 신뢰성 · 모니터링

  • p99 latency, GPU 활용률, 토큰 처리량, 큐 대기 시간 등 핵심 지표를 수집하고 대시보드화합니다.
  • 성능 저하를 사용자 리포트 이전에 선제 탐지하는 알림 체계를 구축합니다.
  • 서비스별 latency와 비용 요구사항에 맞춰 모델을 어떤 GPU에 올릴지 결정합니다.

| 자격요건

"이런 분이라면 목표 달성에 확신을 얻을 것 같아요"

  • 추론 최적화 프레임워크(TensorRT, TensorRT-LLM, vLLM, ONNX Runtime 등) 중 하나 이상으로 모델을 프로덕션에 서빙해본 경험이 있으신 분
  • GPU 추론 경험이 있고, 배치 크기 · GPU 메모리 · throughput · latency 사이의 트레이드오프를 설명할 수 있으신 분
  • 추론에 사용되는 주요 연산(matmul, softmax/sigmoid, cumsum, attention 등)이 어디에서 병목이 되는지 이해하고 계신 분
  • 리눅스 서버와 컨테이너 환경에서 프로세스, 메모리, 네트워크, 로그를 스스로 추적해 문제를 좁혀갈 수 있으신 분

| 우대 사항

"이런 분이라면 장기적으로 서로에게 더 긍정적일 것 같아요!"

  • Python 웹 프레임워크(FastAPI, Django, Flask) 중 하나로 프로덕션 서비스를 개발하고 운영해본 경험이 있으신 분
  • 모델 경량화(quantization, pruning, distillation) 및 학습 코드 작성 경험이 있으신 분
  • 다양한 GPU(H200, A100, A10G, L40S 등) 아키텍처에서 추론 가속 경험이 있으신 분
  • CUDA 이해 및 프로파일링 도구(Nsight Systems, PyTorch Profiler 등) 활용 경험이 있으신 분
  • 검색, 추천 등 대규모 실시간 트래픽 시스템의 서빙 경험이 있으신 분

| 이런 분과 함께하고 싶습니다

  • 모델의 정확도뿐 아니라, 그 모델이 실제로 몇 ms에 얼마의 비용으로 도는지에 관심이 있는 분
  • 추측 대신 프로파일링과 측정으로 병목을 찾는 것을 선호하는 분
  • 장애를 개인의 실수가 아니라 시스템의 개선점으로 다루는 분

| 기타 사항

  • [서류 전형] - [1차 인터뷰] - [처우 협의] - [입사] 의 프로세스로 진행됩니다.
  • 서류는 원활한 검토를 위해 PDF 형식으로 제출 부탁 드립니다.
  • 직무/직급에 따라 2차 인터뷰가 추가될 수 있습니다.
  • 직급에 따라 인터뷰 후 레퍼런스 체크 전형이 추가될 수 있습니다.
  • 입사 후 3개월의 수습 기간 및 수습 평가가 진행됩니다. (급여 100%)
  • 서류 전형 결과 안내까지는 최대 2주, 인터뷰 결과 안내까지는 최대 3주가 소요됩니다.
  • 여러 포지션에 동시에 지원해주시는 것은 가능하지만 동일한 포지션의 경우 최종 결과 안내를 받은 시점으로부터 6개월 후에 재지원이 가능합니다.