후속 학습 (Post-training)
이 페이지는 자동화 문맥에서 자주 쓰이는 후속 학습 (Post-training)의 뜻과 쓰임을 중급 난이도 기준으로 정리한 AI 용어사전 항목입니다. 정의와 맥락, 관련 용어 6개 순서로 묶었으니, 아래 설명을 먼저 읽고 연결된 개념과 글까지 이어서 보면 이해가 빨라집니다.
후속 학습(Post-training)은 사전학습을 마친 AI 모델이 지시를 따르고 특정 작업을 수행하도록 추가로 학습시키는 과정입니다. 포스트 트레이닝이라고도 부르며, 기본 모델이 배운 언어와 지식을 실제 대화, 문제 풀이, 도구 사용에 맞게 다듬는 데 쓰입니다.
사전학습 뒤에 무엇을 더 배우는가
많은 문장을 이어 쓰도록 학습한 모델도 사용자가 원하는 답변 방식까지 저절로 익히는 것은 아닙니다. 질문에 답하는 대신 비슷한 질문을 이어 쓰거나, 정해진 출력 형식을 지키지 못할 수 있습니다. 후속 학습에서는 어떤 입력에 어떤 응답이 바람직한지에 관한 예시나 평가 신호를 사용합니다. NVIDIA의 AI 학습 설명도 사전학습 이후 지시 수행, 대화, 추론과 같은 능력을 다듬는 과정을 구분해 설명합니다.
예를 들어 고객 문의를 분류하는 모델을 만든다고 가정해 보겠습니다. 사전학습으로 한국어 문장을 읽는 기본 능력을 얻은 모델에 문의 내용과 올바른 분류 결과를 보여 줍니다. 배송 지연은 배송 문의로, 결제 취소는 환불 문의로 분류하는 예시를 학습할 수 있습니다. 같은 문의에 불필요하게 긴 답을 붙이지 않고 지정한 항목만 출력하는 방식도 학습 대상이 됩니다. 이 예시는 추가 학습의 목적을 보여 주며 특정 모델의 성능을 보장하지는 않습니다.
후속 학습은 하나의 알고리즘 이름이 아닙니다. 어떤 데이터를 쓰는지, 모델의 어느 부분을 조정하는지, 결과를 어떻게 평가하는지에 따라 방법이 달라집니다. 파인튜닝은 이미 학습한 모델을 추가 데이터에 맞춰 조정하는 방법을 가리키고, 후속 학습은 사전학습 이후 모델을 다듬는 여러 작업을 묶어 부를 때 쓰입니다. 두 표현의 사용 범위는 자료마다 겹칠 수 있으므로 실제 학습 방법도 함께 확인해야 합니다.
예시와 피드백을 사용하는 방법
지도 파인튜닝(Supervised Fine-tuning, SFT)은 입력과 바람직한 출력의 짝을 학습하는 방식입니다. 앞의 문의 분류처럼 정답 예시를 주거나, 사용자의 요청에 맞는 대화 응답을 보여 줄 수 있습니다. 인간 피드백으로 지시 수행을 학습한 연구는 사람이 작성한 응답 예시로 모델을 조정한 뒤, 여러 응답의 선호 순위를 모아 추가 학습했습니다. 잘 쓴 예시를 따라 배우는 단계와 응답 간 선호를 배우는 단계가 구분됩니다.
인간 피드백 강화학습(RLHF)은 사람이 더 좋다고 평가한 응답의 정보를 학습에 반영합니다. 대표적인 방식에서는 선호 데이터를 바탕으로 보상 모델을 만들고, 그 보상에 따라 언어 모델을 조정합니다. 직접 선호 최적화(DPO) 연구는 선호하는 응답과 선호하지 않는 응답의 쌍을 사용해 모델을 직접 조정하는 방법을 제안했습니다. 선호 데이터를 사용한다는 공통점이 있어도 보상 모델과 학습 절차가 모두 같은 것은 아닙니다.
정답을 검사할 수 있는 문제에서는 사람의 선호 대신 검사 결과를 보상으로 사용할 수 있습니다. 수학 문제의 최종 답을 대조하거나 생성한 코드가 준비된 테스트를 통과하는지 확인하는 식입니다. 강화학습을 사용한 추론 모델 연구는 이런 규칙 기반 보상과 여러 학습 단계의 조합을 다뤘습니다. 이 연구에는 지도 파인튜닝을 먼저 거치지 않고 기본 모델에 강화학습을 적용한 실험도 있어, 특정 순서를 모든 후속 학습의 필수 절차로 볼 수는 없습니다.
학습 예시를 만드는 데 다른 모델이 생성한 합성 데이터를 쓸 수도 있습니다. 교사 모델의 응답이나 문제 풀이를 학생 모델에 학습시키는 증류도 이 과정에 쓰입니다. 생성된 데이터는 양을 늘리기 쉽지만 틀린 답과 반복된 표현까지 포함할 수 있습니다. 데이터를 만든 방법과 실제로 학습에 채택한 기준을 구분해야 합니다. 사람의 답변이든 모델이 만든 답변이든, 가르치려는 작업에 맞는지 확인하는 과정은 필요합니다.
프롬프트·RAG·추론과의 차이
시스템 프롬프트에 답변 규칙을 적으면 모델은 그 요청의 입력을 읽고 응답합니다. RAG는 답변할 때 관련 문서를 검색해 입력에 넣습니다. 후속 학습은 학습 과정에서 모델의 가중치나 추가한 어댑터를 조정하므로, 지시나 참고 자료를 매번 전달하는 방식과 작동 지점이 다릅니다. 다만 여러 방법을 함께 사용할 수 있습니다. 문의 처리 형식은 학습시키고 자주 바뀌는 배송 정책은 검색으로 제공하는 구성이 한 예입니다.
답변을 생성하는 동안 더 많은 계산을 쓰는 테스트 타임 컴퓨트와도 구분합니다. 후속 학습으로 문제 풀이 능력을 다듬은 모델이 실제 질문을 받았을 때 긴 풀이를 생성할 수 있습니다. 이때 학습에 쓴 계산과 답변을 만드는 데 쓴 계산은 서로 다른 시점의 비용입니다. 모델을 충분히 학습했다고 모든 질문에 긴 풀이가 필요한 것도 아니며, 추론 시간을 늘린다고 학습 데이터의 오류가 자동으로 고쳐지는 것도 아닙니다.
후속 학습의 효과는 학습에 쓰지 않은 질문으로 확인해야 합니다. 문의 분류라면 정확한 분류 비율뿐 아니라 애매한 문의를 어떻게 처리하는지, 지정한 형식을 지키는지도 봅니다. 답변 선호를 학습했다면 읽기 좋은 문장과 사실이 맞는 답변을 구분해 평가해야 합니다. 앞의 인간 피드백 연구에서도 개선된 모델이 여전히 단순한 실수를 했습니다. 학습 방법의 이름만으로 정확성과 안전성을 판단하기는 어렵습니다.
후속 학습을 설명하는 자료를 읽을 때는 기본 모델, 학습 데이터, 평가 기준을 함께 봅니다. 같은 방법도 입력 언어와 작업 유형이 달라지면 효과가 달라질 수 있습니다. 학습 데이터에 맞춘 개선이 다른 작업에서는 성능 저하로 이어지는지도 확인할 필요가 있습니다. 모델 평가를 작업별로 나누면 어떤 능력을 얻었고 어떤 한계가 남았는지 더 구체적으로 이해할 수 있습니다.
관련 용어
후속 학습 (Post-training)와 함께 자주 언급되는 개념들입니다. 비슷한 말처럼 보여도 역할과 쓰임은 다를 수 있습니다.
