Python

Python 관련 최신 글을 모았습니다.

Python에서 Hugging Face TRL PPOTrainer로 Reward Model 점수를 이용해 AI를 강화학습하는 방법을 설명하는 대표 이미지
프로그래밍 · Python

Python 완전정복 시리즈 42: PPOTrainer 완벽 이해하기

Python 완전정복 시리즈 42편입니다. Hugging Face TRL의 PPOTrainer로 Reward Model 점수를 이용해 생성형 AI를 강화학습시키는 전체 구조를 정리했습니다. PPO와 RLHF 개념, Policy Model, Reference Model, Reward Model, Value Model, Prompt Dataset, Episode, Rollout, Reward Score, KL Divergence, KL Penalty, RLHF Reward, Return, Value, Advantage, GAE, Policy Ratio, PPO Clipping, PPOConfig, 최신 PPOTrainer 구조, LoRA·QLoRA, 학습 로그, Reward Hacking, 안정화 방법, DPO·PPO·GRPO 차이와 오류 해결까지 다룹니다.

BeanCon2026-08-15
Python에서 Hugging Face TRL RewardTrainer로 AI 답변 품질을 점수로 평가하는 방법을 설명하는 대표 이미지
프로그래밍 · Python

Python 완전정복 시리즈 41: RewardTrainer 완벽 이해하기

Python 완전정복 시리즈 41편입니다. Hugging Face TRL의 RewardTrainer로 AI 답변 품질을 점수로 평가하는 Reward Model을 만드는 방법을 정리했습니다. Reward Model과 RLHF의 관계, Sequence Classification Head, Chosen·Rejected Pair, Pairwise Preference Learning, Bradley-Terry 모델, Reward Loss, Reward Margin, Pairwise Accuracy, Centered Reward, Reward Dataset 형식, Chat Template, RewardConfig, LoRA·QLoRA Reward Model, score Head 저장, 학습 로그 해석, 임의 답변 점수 계산, 여러 답변 Ranking, Best-of-N Sampling, Gradio AI 답변 심사위원과 오류 해결까지 다룹니다.

BeanCon2026-08-11
Python에서 Hugging Face TRL DPOTrainer로 AI 답변 선호도를 학습하는 방법을 설명하는 대표 이미지
프로그래밍 · Python

Python 완전정복 시리즈 40: DPOTrainer 완벽 이해하기

Python 완전정복 시리즈 40편입니다. Hugging Face TRL의 DPOTrainer로 좋은 답변과 나쁜 답변을 비교해 AI 모델의 선호도를 학습하는 방법을 정리했습니다. DPO와 Preference Optimization, SFT·RLHF와의 차이, Policy Model과 Reference Model, Chosen·Rejected 응답, DPO Loss, Beta, Preference Dataset, Conversational Preference Format, 길이 편향, 데이터 품질 검사, DPOConfig, Loss Type, Reward Accuracy, Reward Margin, Chosen·Rejected Log Probability, LoRA·QLoRA, Reference Log Probability 사전 계산, Adapter 저장·병합, Hub 업로드, Gradio 비교 화면과 오류 해결까지 다룹니다.

BeanCon2026-08-10
Python에서 Hugging Face TRL과 SFTTrainer로 대화형 AI 모델을 Fine-tuning하는 방법을 설명하는 대표 이미지
프로그래밍 · Python

Python 완전정복 시리즈 39: TRL과 SFTTrainer 완벽 이해하기

Python 완전정복 시리즈 39편입니다. Hugging Face TRL과 SFTTrainer로 대화형 AI 모델을 Instruction Dataset으로 Fine-tuning하는 방법을 정리했습니다. SFT와 Instruction Tuning, Base Model과 Instruct Model, Standard Format, Prompt-Completion Dataset, Conversational Dataset, System·User·Assistant 역할, Chat Template, apply_chat_template, EOS Token, Completion Only Loss, Assistant Only Loss, Loss Masking, Packing, SFTConfig, LoRA·QLoRA 연결, Adapter 저장·병합, Hub 업로드, TRL CLI, Gradio 챗봇 연결과 오류 해결까지 다룹니다.

BeanCon2026-08-07
Python에서 Hugging Face PEFT와 LoRA로 AI 모델을 효율적으로 Fine-tuning하는 방법을 설명하는 대표 이미지
프로그래밍 · Python

Python 완전정복 시리즈 #38: PEFT와 LoRA 완벽 이해하기

Python 완전정복 시리즈 38편입니다. Hugging Face PEFT와 LoRA로 거대한 AI 모델의 일부 파라미터만 학습해 비용과 메모리를 줄이는 방법을 정리했습니다. Full Fine-tuning 비용, PEFT 주요 방법, LoRA의 Low-Rank 원리, Rank와 lora_alpha, lora_dropout, target_modules, modules_to_save, LoraConfig, get_peft_model, PeftModel, DistilBERT LoRA 적용, 학습 가능한 파라미터 확인, Trainer 연결, Adapter 저장·로드·비활성화·병합, QLoRA와 BitsAndBytesConfig, 4비트 양자화, 메모리 절감 설정, Hub 업로드와 오류 해결까지 다룹니다.

BeanCon2026-08-05
Python에서 Hugging Face Trainer로 사전 학습 모델을 Fine-tuning하는 방법을 설명하는 대표 이미지
프로그래밍 · Python

Python 완전정복 시리즈 #37: Hugging Face Trainer 완벽 이해하기

Python 완전정복 시리즈 37편입니다. Hugging Face Trainer를 이용해 사전 학습 Transformer 모델을 내 데이터로 Fine-tuning하는 방법을 감정 분석 프로젝트로 정리했습니다. Fine-tuning과 Feature Extraction 차이, Trainer와 TrainingArguments, DistilBERT 데이터셋 준비, Tokenizer, Dynamic Padding, Data Collator, 평가 지표, Accuracy·Precision·Recall·F1, Checkpoint, Early Stopping, 혼합 정밀도 FP16·BF16, Gradient Checkpointing, 학습 재개, 모델 저장, Pipeline 추론, Hugging Face Hub 업로드, GPU 메모리 부족 해결과 데이터 누수 방지까지 다룹니다.

BeanCon2026-08-04
Python에서 Hugging Face Datasets로 AI 학습 데이터를 불러오고 가공하는 방법을 설명하는 대표 이미지
프로그래밍 · Python

Python 완전정복 시리즈 #36: Hugging Face Datasets 완벽 이해하기

Python 완전정복 시리즈 36편입니다. Hugging Face Datasets로 AI 학습 데이터를 불러오고 가공하는 방법을 실습 중심으로 정리했습니다. Dataset과 DatasetDict 구조, Features와 ClassLabel, CSV·JSON·Parquet·Text 파일 로딩, Python 객체와 Pandas 변환, shuffle, select, sort, train_test_split, filter, map, batched map, 멀티프로세싱, 열 추가·삭제·이름 변경, Tokenizer 일괄 적용, PyTorch DataLoader 연결, Streaming, 캐시, 로컬 저장, 오프라인 사용, 버전 고정, 비공개 데이터셋, Hub 공유, 데이터셋 카드와 라이선스, 영화 리뷰 데이터 전처리 프로젝트까지 다룹니다.

BeanCon2026-08-03
Python에서 Hugging Face Transformers로 사전 학습 AI 모델을 사용하는 방법을 설명하는 대표 이미지
프로그래밍 · Python

Python 완전정복 시리즈 #35: Hugging Face Transformers 완벽 이해하기

Python 완전정복 시리즈 35편입니다. Hugging Face Hub와 Transformers 라이브러리로 사전 학습 AI 모델을 Python에서 사용하는 방법을 정리했습니다. Pipeline, Tokenizer, AutoModel, 감정 분석, 텍스트 생성, 요약, 번역, 질문 답변, 개체명 인식, 이미지 분류, 음성 인식, CPU·CUDA·MPS 장치 설정, 메모리 최적화, 배치 처리, 모델 저장과 오프라인 실행, 캐시, 로그인, 비공개 모델, 모델 카드, 라이선스, trust_remote_code 보안, 버전 고정, Gradio와 연결한 멀티 AI 데모 프로젝트까지 다룹니다.

BeanCon2026-08-02
Python Streamlit으로 데이터와 AI 웹앱을 만드는 방법을 설명하는 대표 이미지
프로그래밍 · Python

Python 완전정복 시리즈 #33: Streamlit 완벽 이해하기

Python 완전정복 시리즈 33편입니다. Streamlit으로 HTML, CSS, JavaScript 없이 Python 코드만으로 데이터와 AI 웹앱을 만드는 방법을 실습 중심으로 정리했습니다. 설치와 첫 번째 앱, 앱 실행, 재실행 구조, 페이지 설정, 텍스트와 메시지 출력, 입력 위젯, 버튼, 사이드바, 열·탭·컨테이너, 데이터프레임, 편집 가능한 데이터, 지표 카드, 차트, Matplotlib 연결, 이미지·오디오·비디오, 파일 업로드와 다운로드, Form, Session State, Callback, 캐시, 로딩 상태, 채팅 UI, 멀티페이지, 테마, 비밀정보 관리, AI 붓꽃 분류 웹앱, CSV 일괄 예측, 배포, Docker 개념, 테스트, 성능과 보안 주의사항까지 다룹니다.

BeanCon2026-08-01