<?xml version="1.0" encoding="utf-8" standalone="yes"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/">
  <channel>
    <title>VLLM on KKKZOZ&#39;s Blog</title>
    <link>http://blog.kkkzoz.top/tags/vllm/</link>
    <description>Recent content in VLLM on KKKZOZ&#39;s Blog</description>
    <image>
      <title>KKKZOZ&#39;s Blog</title>
      <url>http://blog.kkkzoz.top/images/papermod-cover.png</url>
      <link>http://blog.kkkzoz.top/images/papermod-cover.png</link>
    </image>
    <generator>Hugo -- 0.147.0</generator>
    <language>en</language>
    <lastBuildDate>Tue, 11 Aug 2026 14:08:08 +0800</lastBuildDate>
    <atom:link href="http://blog.kkkzoz.top/tags/vllm/index.xml" rel="self" type="application/rss+xml" />
    <item>
      <title>vllm &amp; torch.compile</title>
      <link>http://blog.kkkzoz.top/posts/learning/ml-compilers/vllm--torch.compile/</link>
      <pubDate>Tue, 11 Aug 2026 00:00:00 +0000</pubDate>
      <guid>http://blog.kkkzoz.top/posts/learning/ml-compilers/vllm--torch.compile/</guid>
      <description>&lt;p&gt;vLLM 中同时存在多条与 FX 和 &lt;code&gt;torch.compile&lt;/code&gt; 相关的执行路径，它们虽然共享 PyTorch 的 graph infrastructure，但解决的问题并不相同。理解这些路径的边界，是区分“模型结构改写”“Inductor 编译优化”和“CUDA Graph replay”的前提。&lt;/p&gt;
&lt;p&gt;进入正文前，可以先区分三类用法：&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;HF Transformers modeling backend&lt;/strong&gt;：直接使用 &lt;code&gt;fx.Tracer&lt;/code&gt; 分析 Hugging Face &lt;code&gt;forward&lt;/code&gt;，识别可融合结构并通过 AST 改写模型源码&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;vLLM 自定义 &lt;code&gt;torch.compile&lt;/code&gt; 主路径&lt;/strong&gt;：由 Dynamo 产生完整 FX &lt;code&gt;GraphModule&lt;/code&gt;，再由 vLLM 控制 graph partition、shape specialization、custom passes、cache 和 CUDA Graph integration&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;普通 &lt;code&gt;@torch.compile&lt;/code&gt; 小函数&lt;/strong&gt;：FX 主要作为 Dynamo、AOTAutograd 和 Inductor 的内部 IR，vLLM 通常不直接处理这些 graph&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;Piecewise CUDA Graph 不是第四条独立的 tracing 路径，而是建立在 vLLM Piecewise Compilation 之上的运行时优化：编译阶段先拆分并编译 graph regions，随后只对兼容区域执行 CUDA Graph capture/replay。&lt;/p&gt;
&lt;blockquote&gt;
&lt;p&gt;这篇文章的核心问题是：vLLM 如何围绕标准 &lt;code&gt;torch.compile&lt;/code&gt; 增加一层 LLM-serving-aware 的 graph processing、compilation policy 和 runtime integration。&lt;/p&gt;</description>
    </item>
  </channel>
</rss>
