Assignment 5Post-trainingHow a pretrained model learns from demonstrations, feedback, and rewards.Supervised fine-tuningReward signals and evaluationPolicy gradients for reasoningStanford assignment materials← All tracks