귀하는 로그인되어 있지 않습니다. 이대로 편집하면 귀하의 IP 주소가 편집 기록에 남게 됩니다.스팸 방지 검사입니다. 이것을 입력하지 마세요!==== 대처 방법 ==== * '''배치 크기 축소''': 가장 간단하고 직접적인 해결책이지만 학습 속도나 [[그래디언트]] 추정의 안정성에 영향을 줄 수 있다. * '''그래디언트 누적(Gradient Accumulation)''': 배치 크기를 줄이는 대신 여러 스텝에 걸쳐 그래디언트를 누적한 뒤 한 번에 업데이트하여, 메모리는 적게 쓰면서도 사실상 큰 배치로 학습한 것과 유사한 효과를 낸다. * '''혼합 정밀도 학습(Mixed Precision Training)''': 32비트 부동소수점 대신 16비트([[FP16]]/[[BF16]])를 사용해 메모리 사용량과 연산 속도를 동시에 개선한다. * '''그래디언트 체크포인팅(Gradient Checkpointing)''': 역전파에 필요한 중간 활성화 값을 모두 저장하지 않고 일부만 저장한 뒤 필요할 때 재계산하는 방식으로, 연산량을 늘리는 대신 메모리 사용량을 크게 줄인다. * '''모델 병렬화 및 분산 학습''': [[DeepSpeed]]의 [[ZeRO]], [[FSDP]](Fully Sharded Data Parallel) 등을 이용해 모델 가중치·옵티마이저 상태·그래디언트를 여러 GPU에 나누어 저장한다. * '''양자화(Quantization) 및 LoRA''': 추론 시에는 모델을 [[INT8]]/[[INT4]] 등으로 양자화하고, 파인튜닝 시에는 전체 파라미터 대신 일부 저랭크(low-rank) 파라미터만 학습하는 [[LoRA]](Low-Rank Adaptation) 기법을 사용해 필요한 메모리를 대폭 줄인다. * '''오프로딩(Offloading)''': VRAM에 다 올리지 못하는 부분을 시스템 RAM이나 [[NVMe]] SSD로 내려서 관리하는 방식. 속도는 느려지지만 아예 학습이 불가능한 상황은 피할 수 있다. 편집 요약 가온 위키에서의 모든 기여는 크리에이티브 커먼즈 저작자표시-동일조건변경허락 라이선스로 배포된다는 점을 유의해 주세요(자세한 내용에 대해서는 가온 위키:저작권 문서를 읽어주세요). 만약 여기에 동의하지 않는다면 문서를 저장하지 말아 주세요. 또한, 직접 작성했거나 퍼블릭 도메인과 같은 자유 문서에서 가져왔다는 것을 보증해야 합니다. 저작권이 있는 내용을 허가 없이 저장하지 마세요! 취소 편집 도움말 (새 창에서 열림)