LLMOps란 무엇인가: 대형 언어 모델을 업무에 안정적으로 쓰기 위한 운영 체계 완전 정리

LLMOps란, 대형 언어 모델을 업무에 배포한 뒤 프롬프트와 모델 버전, 검색 데이터, 답변 품질과 비용을 함께 관리해 결과를 일정한 수준으로 유지하는 운영 체계입니다.

LLMOps가 필요한 이유

같은 질문에 다른 답이 나왔습니다.

대형 언어 모델은 시연 단계에서 인상적인 결과를 보여 줍니다. 그런데 업무에 배포하고 몇 주가 지나면 지난주에 잘 되던 질문에 엉뚱한 답이 나오거나, 답변 형식이 바뀌어 후속 시스템이 결과를 읽지 못하는 일이 생깁니다. 비용이 예상보다 빠르게 늘어나는 경우도 흔합니다.

원인은 여러 곳에 있습니다. 누군가 프롬프트 문구를 고쳤을 수도 있고, 모델 공급처가 버전을 갱신했을 수도 있고, 검색 대상 문서가 바뀌었을 수도 있습니다. 무엇이 언제 바뀌었는지 기록이 없으면 원인을 찾는 데만 며칠이 걸립니다.

기존 소프트웨어는 코드가 같으면 결과도 같습니다. 대형 언어 모델은 코드 밖에 있는 문장과 데이터, 외부 모델에 따라 결과가 달라지므로 이 요소들을 따로 관리하는 체계가 필요합니다.

이 요구는 대형 언어 모델이 답변 생성에 그치지 않고 업무 판단과 처리에 쓰일수록 커집니다. 답변이 조금 달라지는 것은 참고용 챗봇에서는 불편에 그치지만, 심사나 등록 같은 업무에서는 잘못된 처리로 이어지기 때문입니다.

LLMOps의 정확한 정의: MLOps와 무엇이 다른가

MLOps와 LLMOps, 세 가지 축의 차이

첫째, 관리 대상이 다릅니다. MLOps는 조직이 직접 학습시킨 모델과 그 학습 데이터를 중심으로 관리합니다. LLMOps에서는 모델을 직접 학습시키지 않는 경우가 많아 프롬프트와 검색 데이터, 모델 선택과 호출 설정이 주된 관리 대상이 됩니다.

둘째, 변화가 생기는 곳이 다릅니다. MLOps에서는 모델을 바꾸는 주체가 조직 내부입니다. LLMOps에서는 외부 공급처가 모델을 갱신하거나 이전 버전의 제공을 종료하는 일처럼 조직이 통제하지 못하는 변화가 생깁니다.

셋째, 평가 방식이 다릅니다. MLOps의 평가는 분류 정답률이나 수치 오차처럼 정답과 바로 비교할 수 있는 지표가 중심입니다. LLMOps는 문장으로 된 답변을 다루므로 근거 문서와 일치하는지, 형식을 지켰는지, 쓰면 안 되는 표현이 없는지 등 여러 기준을 함께 봐야 합니다.

두 체계는 대체 관계가 아닙니다. 버전 관리와 배포 전 검증, 운영 모니터링이라는 MLOps의 원칙을 대형 언어 모델의 특성에 맞게 적용한 것이 LLMOps입니다.

LLMOps가 관리하는 4가지 대상

운영 중 버전으로 남겨야 할 4가지 대상

첫째, 프롬프트입니다. 지시문과 예시, 출력 형식 정의는 코드처럼 버전을 붙이고 누가 왜 바꿨는지 기록합니다. 문장 하나를 고쳐도 결과가 크게 달라질 수 있기 때문입니다.

둘째, 모델 버전과 공급처입니다. 어떤 모델의 어떤 버전을 어떤 설정으로 호출했는지 남기고, 공급처의 버전 종료 일정을 추적합니다.

셋째, 검색 데이터입니다. 답변의 근거가 되는 문서 묶음과 청크 기준, 색인 시점을 관리해야 답변이 달라졌을 때 데이터 때문인지 가려낼 수 있습니다.

넷째, 평가와 비용입니다. 고정된 질문 세트에 대한 채점 결과와 호출당 비용, 응답 시간을 버전별로 비교할 수 있게 쌓아 둡니다.

네 대상 중 하나라도 기록이 빠지면 결과가 바뀌었을 때 원인을 좁힐 수 없습니다. 네 요소의 버전 조합을 한 번의 배포 단위로 묶어 두는 것이 좋습니다.

LLMOps의 실제 적용 방법

평가 질문 세트를 먼저 만듭니다

운영에 들어가기 전에 실제 업무에서 나올 질문과 기대 답변, 근거 문서를 묶은 평가 세트를 만듭니다. 세무 분야 사례에서는 대상 문서를 정하고 실제 질의를 모아 RAG 평가 세트를 구성했습니다.

채점 기준도 함께 정합니다. 근거 문서와 일치하는지, 필요한 항목을 빠뜨리지 않았는지, 정해진 형식을 지켰는지를 문항마다 판정할 수 있어야 합니다.

이 세트가 있어야 프롬프트나 모델을 바꿀 때마다 같은 기준으로 전후를 비교할 수 있습니다. 운영 중 새로 발견한 실패 사례는 평가 세트에 추가해 같은 문제가 다시 생기지 않는지 확인합니다.

변경은 한 번에 하나씩 반영합니다

프롬프트와 모델, 검색 데이터를 동시에 바꾸면 결과가 좋아지거나 나빠져도 무엇 때문인지 알 수 없습니다. 한 번에 한 요소만 바꾸고 평가 세트로 검증한 뒤 승인을 거쳐 운영에 반영합니다. 문제가 생기면 직전 조합으로 바로 되돌릴 수 있게 이전 버전을 남겨 둡니다.

호출 기록을 남기고 비용을 나눠 봅니다

운영 중 호출마다 입력과 출력, 사용한 버전, 응답 시간, 비용을 기록합니다. 업무별, 부서별로 비용을 나눠 보면 어느 업무에서 비용이 커지는지 알 수 있고, 가벼운 모델로 충분한 업무를 골라낼 수 있습니다. 호출 기록은 사용자가 이상한 답변을 신고했을 때 당시의 입력과 버전을 재현하는 근거로도 쓰입니다.

국내 환경에서의 LLMOps

국내 금융과 공공은 망분리 규제로 외부 모델 API를 쓰기 어려운 경우가 많아 내부에 설치한 모델을 함께 운영하는 구성이 흔합니다. 이 경우 모델 교체와 성능 비교를 내부 환경에서 할 수 있어야 합니다.

외부 모델을 쓸 때는 프롬프트에 개인정보가 들어가지 않도록 입력 단계에서 가리고, 호출 기록의 저장 위치와 보관 기간을 정해 둡니다. 한국어 업무 문서로 평가 세트를 만들어야 실제 성능을 판단할 수 있습니다.

자주 묻는 질문

필요합니다. 프롬프트와 검색 데이터, 외부 모델 버전이 계속 바뀌므로 오히려 학습 없이 쓰는 조직에서 관리 공백이 더 쉽게 생깁니다.

AI Ops는 AI 모델과 에이전트 전반의 운영 체계이고, LLMOps는 그중 대형 언어 모델에 특화된 관리 영역입니다.

해야 합니다. 프롬프트는 결과에 직접 영향을 주는 설정이므로 변경 이력과 평가 결과를 함께 남깁니다.

새 버전을 평가 세트로 먼저 채점하고, 기준을 통과한 뒤에 전환합니다. 가능하면 호출 시 버전을 고정해 예고 없는 변화를 막습니다.

평가 세트에 근거 일치 여부를 채점 항목으로 넣고, 운영 중에는 근거 없이 나온 답변의 비율을 지켜보는 방식으로 관리합니다.

업무별 호출 기록으로 비용이 큰 곳을 찾고, 요구 품질을 만족하는 더 가벼운 모델이나 짧은 프롬프트로 바꿔 평가해 봅니다.

처음부터 도구를 갖출 필요는 없습니다. 평가 질문 세트와 변경 기록표만 있어도 운영 중 문제의 원인을 훨씬 빨리 찾을 수 있습니다.

관련 용어