<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/"><channel><title>Transformer on SiBlog</title><link>https://sinimite.work/tags/transformer/</link><description>Recent content in Transformer on SiBlog</description><image><title>SiBlog</title><url>https://sinimite.work/images/og-default.svg?v=20260525-210321</url><link>https://sinimite.work/images/og-default.svg?v=20260525-210321</link></image><generator>Hugo -- 0.156.0</generator><language>zh-cn</language><lastBuildDate>Sun, 26 Jul 2026 00:00:00 +0000</lastBuildDate><atom:link href="https://sinimite.work/tags/transformer/rss.xml" rel="self" type="application/rss+xml"/><item><title>梯度下降：大语言模型如何从‘胡乱猜词’学会生成文本</title><link>https://sinimite.work/posts/gradient-descent-for-llm-training/</link><pubDate>Sun, 26 Jul 2026 00:00:00 +0000</pubDate><guid>https://sinimite.work/posts/gradient-descent-for-llm-training/</guid><description>面向没有机器学习背景的普通程序员，用直观例子解释大语言模型训练中的梯度下降、损失函数、反向传播、学习率与优化器。</description></item><item><title>LLM 的“心口不一”: 理解 LLM 行为的一把万能钥匙</title><link>https://sinimite.work/posts/llm-from-hidden-state-to-token-output/</link><pubDate>Sat, 02 May 2026 00:00:00 +0000</pubDate><guid>https://sinimite.work/posts/llm-from-hidden-state-to-token-output/</guid><description>为什么 Chain of Thought 有效，为什么 prompt 不是越长越好，为什么模型会幻觉？这些看似无关的工程现象，背后其实是同一个核心机制在不同侧面的体现。本文用一把“万能钥匙”打开 LLM 工程的五扇门。</description></item><item><title>大模型训练全景：一个 AI 应用工程师需要理解的一切</title><link>https://sinimite.work/posts/llm-training-for-ai-engineers/</link><pubDate>Sat, 04 Apr 2026 12:00:00 +0900</pubDate><guid>https://sinimite.work/posts/llm-training-for-ai-engineers/</guid><description>一篇面向 AI 应用工程师的大模型训练全景指南，覆盖预训练、后训练、蒸馏、Reward 设计、Agent 训练与 Harness Engineering，帮助你理解模型能力从何而来，以及这些训练决策如何影响真实应用落地。</description></item><item><title>WHAT is LLM API KV Cache</title><link>https://sinimite.work/posts/llm-api-kv-cache/</link><pubDate>Thu, 05 Mar 2026 11:09:00 +0900</pubDate><guid>https://sinimite.work/posts/llm-api-kv-cache/</guid><description>KV Cache 是连接「Transformer 理论」和「LLM 工程部署」的一个关键概念。理解它，你就打通了从「模型怎么算」到「模型怎么跑」的最后一环。</description></item><item><title>理解 Transformer 的数学直觉</title><link>https://sinimite.work/posts/understanding-transformer-intuition/</link><pubDate>Tue, 24 Feb 2026 12:00:00 +0900</pubDate><guid>https://sinimite.work/posts/understanding-transformer-intuition/</guid><description>我的第一篇正式博客文章。</description></item></channel></rss>