記事
LLM 推論のプリフィルとデコード
一般的な LLM の推論が持つプリフィルとデコードという 2 つのフェーズについて、なぜ片方は計算が、もう片方はメモリの読み出しがボトルネックになりやすいのかを、KubeCon + CloudNativeCon Japan 2026 のセッションをきっかけに整理しました。
このタグが付いているものです。種別をまたいで新しい順に並んでいます。
一般的な LLM の推論が持つプリフィルとデコードという 2 つのフェーズについて、なぜ片方は計算が、もう片方はメモリの読み出しがボトルネックになりやすいのかを、KubeCon + CloudNativeCon Japan 2026 のセッションをきっかけに整理しました。