<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>Memory Management on 中文AI术语词典</title><link>https://terms-en.ai-term-hub.com/zh/tags/memory-management/</link><description>Recent content in Memory Management on 中文AI术语词典</description><generator>Hugo</generator><language>zh-cn</language><lastBuildDate>Sat, 18 Jul 2026 11:44:45 +0000</lastBuildDate><atom:link href="https://terms-en.ai-term-hub.com/zh/tags/memory-management/index.xml" rel="self" type="application/rss+xml"/><item><title>PagedAttention</title><link>https://terms-en.ai-term-hub.com/zh/terms/pagedattention/</link><pubDate>Sat, 18 Jul 2026 11:29:14 +0000</pubDate><guid>https://terms-en.ai-term-hub.com/zh/terms/pagedattention/</guid><description>&lt;h2 id="definition">Definition&lt;/h2>
&lt;p>PagedAttention 是由 vLLM 项目引入的一项技术，旨在提高大语言模型推理的效率。它解决了管理 KV 缓存时的碎片化和开销问题，通过将 KV 缓存视为非连续的内存块进行分配和管理，从而显著减少了内存浪费，提高了吞吐量并降低了显存占用。&lt;/p>
&lt;h3 id="summary">Summary&lt;/h3>
&lt;p>PagedAttention 是一种内存管理算法，它将虚拟内存分页概念应用于优化 Transformer 模型中键值（KV）缓存的存储和访问。&lt;/p>
&lt;h2 id="key-concepts">Key Concepts&lt;/h2>
&lt;ul>
&lt;li>KV 缓存管理&lt;/li>
&lt;li>内存碎片化&lt;/li>
&lt;li>推理优化&lt;/li>
&lt;li>虚拟内存分页&lt;/li>
&lt;/ul>
&lt;h2 id="use-cases">Use Cases&lt;/h2>
&lt;ul>
&lt;li>高吞吐量大语言模型服务&lt;/li>
&lt;li>减少 GPU 内存使用&lt;/li>
&lt;li>生产环境中的批处理优化&lt;/li>
&lt;/ul>
&lt;h2 id="related-terms">Related Terms&lt;/h2>
&lt;ul>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/vllm-%E9%AB%98%E6%80%A7%E8%83%BDllm%E6%8E%A8%E7%90%86%E5%BC%95%E6%93%8E/">vLLM (高性能LLM推理引擎)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/key-value-cache-%E9%94%AE%E5%80%BC%E7%BC%93%E5%AD%98/">Key-Value Cache (键值缓存)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/transformer-architecture-transformer%E6%9E%B6%E6%9E%84/">Transformer Architecture (Transformer架构)&lt;/a>&lt;/li>
&lt;li>&lt;a href="https://terms-en.ai-term-hub.com/en/terms/gpu-memory-optimization-gpu%E5%86%85%E5%AD%98%E4%BC%98%E5%8C%96/">GPU Memory Optimization (GPU内存优化)&lt;/a>&lt;/li>
&lt;/ul></description></item></channel></rss>