Gradient Descent: How Large Language Models Learn to Generate Text from Random Guesses
An intuitive introduction for programmers without a machine-learning background to gradient descent, loss functions, backpropagation, learning rates, and optimizers in LLM training, from next-token prediction through parameter updates.