Python

Python 관련 최신 글을 모았습니다.

Python에서 Hugging Face TRL BCOTrainer로 좋아요와 싫어요 Binary Feedback을 학습해 AI를 정렬하는 방법을 설명하는 대표 이미지
프로그래밍 · Python

Python 완전정복 시리즈 46: BCOTrainer 완벽 이해하기

Python 완전정복 시리즈 46편입니다. Hugging Face TRL의 BCOTrainer를 이용해 좋아요와 싫어요 같은 Binary Feedback을 분류 문제처럼 활용해 언어 모델을 정렬하는 방법을 정리했습니다. BCO와 KTO·DPO의 차이, Implicit Reward, Reward Shift, UDM, Reference Model, Beta, LoRA·QLoRA, Label Leakage, 실서비스 Feedback Dataset 구축과 실전 학습 코드까지 다룹니다.

BeanCon2026-08-23
Python에서 Hugging Face TRL KTOTrainer로 좋아요와 싫어요 피드백을 이용해 AI 선호도를 학습하는 방법을 설명하는 대표 이미지
프로그래밍 · Python

Python 완전정복 시리즈 45: KTOTrainer 완벽 이해하기

Python 완전정복 시리즈 45편입니다. Hugging Face TRL의 KTOTrainer를 이용해 Chosen·Rejected 쌍 없이 Prompt, Completion, Label 기반 좋아요와 싫어요 데이터로 언어 모델의 선호도를 조정하는 방법을 정리했습니다. KTO와 DPO의 차이, Prospect Theory, Reference Model, Beta, 데이터 불균형, LoRA·QLoRA, 실서비스 로그 정제, KTOConfig, 실전 학습 코드와 운영 파이프라인까지 다룹니다.

BeanCon2026-08-20
Python에서 Hugging Face TRL RLOOTrainer로 Leave-One-Out Reward Baseline을 이용해 AI를 강화학습하는 방법을 설명하는 대표 이미지
프로그래밍 · Python

Python 완전정복 시리즈 44: RLOOTrainer 완벽 이해하기

Python 완전정복 시리즈 44편입니다. Hugging Face TRL의 RLOOTrainer로 Value Model 없이 자기 자신을 제외한 평균 Reward를 Baseline으로 사용해 생성형 AI를 강화학습하는 방법을 정리했습니다. RLOO와 REINFORCE, PPO·GRPO와의 차이, Leave-One-Out Baseline, Advantage 계산, num_generations, Reward Function, Accuracy Reward, Format Reward, 여러 Reward 조합, KL Penalty, Reference Model, Importance Sampling Ratio, Policy Clipping, RLOOConfig, LoRA·QLoRA, vLLM 가속, 실전 수학 프로젝트, Reward Hacking과 오류 해결까지 다룹니다.

BeanCon2026-08-18
Python에서 Hugging Face TRL GRPOTrainer로 여러 답변의 상대 보상을 비교해 AI를 강화학습하는 방법을 설명하는 대표 이미지
프로그래밍 · Python

Python 완전정복 시리즈 43: GRPOTrainer 완벽 이해하기

Python 완전정복 시리즈 43편입니다. Hugging Face TRL의 GRPOTrainer로 Value Model 없이 여러 답변을 비교해 추론형 AI를 강화학습하는 방법을 정리했습니다. GRPO와 PPO의 차이, Group Sampling, Reward Function, Group Mean, Group Standard Deviation, Relative Advantage, Reward Zero Std, Outcome Reward, Accuracy Reward, Format Reward, 여러 Reward Function 조합, Reward Weight, KL Penalty, Policy Ratio와 Clipping, DAPO Loss, Dr. GRPO, GRPOConfig, LoRA·QLoRA, vLLM 생성 가속, 수학 추론 프로젝트, Reward Hacking과 오류 해결까지 다룹니다.

BeanCon2026-08-17
Python에서 Hugging Face TRL PPOTrainer로 Reward Model 점수를 이용해 AI를 강화학습하는 방법을 설명하는 대표 이미지
프로그래밍 · Python

Python 완전정복 시리즈 42: PPOTrainer 완벽 이해하기

Python 완전정복 시리즈 42편입니다. Hugging Face TRL의 PPOTrainer로 Reward Model 점수를 이용해 생성형 AI를 강화학습시키는 전체 구조를 정리했습니다. PPO와 RLHF 개념, Policy Model, Reference Model, Reward Model, Value Model, Prompt Dataset, Episode, Rollout, Reward Score, KL Divergence, KL Penalty, RLHF Reward, Return, Value, Advantage, GAE, Policy Ratio, PPO Clipping, PPOConfig, 최신 PPOTrainer 구조, LoRA·QLoRA, 학습 로그, Reward Hacking, 안정화 방법, DPO·PPO·GRPO 차이와 오류 해결까지 다룹니다.

BeanCon2026-08-15
Python에서 Hugging Face TRL RewardTrainer로 AI 답변 품질을 점수로 평가하는 방법을 설명하는 대표 이미지
프로그래밍 · Python

Python 완전정복 시리즈 41: RewardTrainer 완벽 이해하기

Python 완전정복 시리즈 41편입니다. Hugging Face TRL의 RewardTrainer로 AI 답변 품질을 점수로 평가하는 Reward Model을 만드는 방법을 정리했습니다. Reward Model과 RLHF의 관계, Sequence Classification Head, Chosen·Rejected Pair, Pairwise Preference Learning, Bradley-Terry 모델, Reward Loss, Reward Margin, Pairwise Accuracy, Centered Reward, Reward Dataset 형식, Chat Template, RewardConfig, LoRA·QLoRA Reward Model, score Head 저장, 학습 로그 해석, 임의 답변 점수 계산, 여러 답변 Ranking, Best-of-N Sampling, Gradio AI 답변 심사위원과 오류 해결까지 다룹니다.

BeanCon2026-08-11
Python에서 Hugging Face TRL DPOTrainer로 AI 답변 선호도를 학습하는 방법을 설명하는 대표 이미지
프로그래밍 · Python

Python 완전정복 시리즈 40: DPOTrainer 완벽 이해하기

Python 완전정복 시리즈 40편입니다. Hugging Face TRL의 DPOTrainer로 좋은 답변과 나쁜 답변을 비교해 AI 모델의 선호도를 학습하는 방법을 정리했습니다. DPO와 Preference Optimization, SFT·RLHF와의 차이, Policy Model과 Reference Model, Chosen·Rejected 응답, DPO Loss, Beta, Preference Dataset, Conversational Preference Format, 길이 편향, 데이터 품질 검사, DPOConfig, Loss Type, Reward Accuracy, Reward Margin, Chosen·Rejected Log Probability, LoRA·QLoRA, Reference Log Probability 사전 계산, Adapter 저장·병합, Hub 업로드, Gradio 비교 화면과 오류 해결까지 다룹니다.

BeanCon2026-08-10
Python에서 Hugging Face TRL과 SFTTrainer로 대화형 AI 모델을 Fine-tuning하는 방법을 설명하는 대표 이미지
프로그래밍 · Python

Python 완전정복 시리즈 39: TRL과 SFTTrainer 완벽 이해하기

Python 완전정복 시리즈 39편입니다. Hugging Face TRL과 SFTTrainer로 대화형 AI 모델을 Instruction Dataset으로 Fine-tuning하는 방법을 정리했습니다. SFT와 Instruction Tuning, Base Model과 Instruct Model, Standard Format, Prompt-Completion Dataset, Conversational Dataset, System·User·Assistant 역할, Chat Template, apply_chat_template, EOS Token, Completion Only Loss, Assistant Only Loss, Loss Masking, Packing, SFTConfig, LoRA·QLoRA 연결, Adapter 저장·병합, Hub 업로드, TRL CLI, Gradio 챗봇 연결과 오류 해결까지 다룹니다.

BeanCon2026-08-07
Python에서 Hugging Face PEFT와 LoRA로 AI 모델을 효율적으로 Fine-tuning하는 방법을 설명하는 대표 이미지
프로그래밍 · Python

Python 완전정복 시리즈 #38: PEFT와 LoRA 완벽 이해하기

Python 완전정복 시리즈 38편입니다. Hugging Face PEFT와 LoRA로 거대한 AI 모델의 일부 파라미터만 학습해 비용과 메모리를 줄이는 방법을 정리했습니다. Full Fine-tuning 비용, PEFT 주요 방법, LoRA의 Low-Rank 원리, Rank와 lora_alpha, lora_dropout, target_modules, modules_to_save, LoraConfig, get_peft_model, PeftModel, DistilBERT LoRA 적용, 학습 가능한 파라미터 확인, Trainer 연결, Adapter 저장·로드·비활성화·병합, QLoRA와 BitsAndBytesConfig, 4비트 양자화, 메모리 절감 설정, Hub 업로드와 오류 해결까지 다룹니다.

BeanCon2026-08-05