返回知识库
0

title: "Shopify 推出 Gisting:将 LLM 系统提示词压缩为学习的标记"
source_url: "https://www.infoq.com/news/2026/09/spotify-gisting-llm-performance/?utm_campaign=infoq_content&utm_source=infoq&utm_medium=feed&utm_term=global"
author: "InfoQ"
excerpt: "公共早报 Shopify 的 Gisting 技术将长 LLM 系统提示词压缩为学习的摘要标记,实现 4:1 上下文压缩,同时吞吐量提升 4 倍,为 Sidekick 智能体降低 38% 延迟。"


Shopify 工程团队推出了 Gisting,这是一种将长 LLM 提示词压缩为更小的学习"gist"标记集的新技术,可提高吞吐量并降低推理成本。

Shopify 强调,在推理时用简洁的 gist 标记替换冗长的文本,可以减少端到端延迟、降低基础设施成本并提高标记吞吐量,而无需修改模型的核心权重。

该公司表示,Gisting 将 Sidekick GraphQL 智能体的系统提示词从约 6000 个标记减少到 1500 个 gist 标记,同时不牺牲预测质量。这意味着上下文大小减少了 4:1:

在 350 请求/分钟(RPM)下,首个标记时间(TTFT)中位数从 438ms 降至 354ms,端到端请求延迟中位数从 6.8s 降至 4.2s,吞吐量从 20.2 提升至 23.4 查询/秒(QPS)。

这些改进后的指标使 Shopify 能够减少分配的 GPU 数量。

Gisting 基于 2022 年一篇论文"Prompt Compression and Contrastive Conditioning for Controllability and Toxicity Reduction in Language Models"中开创的技术,包含一个两步过程来学习新压缩 gist 标记的嵌入。在第一次传递(教师传递)中,使用真实提示词运行模型,得出响应的教师 logits。在学生传递中,使用 gist 标记运行模型,得出学生 logits。最后,gist 被训练为最小化教师 logits 和学生 logits 之间的 KL 散度——即直到学生的预测与教师的预测高度接近。

训练完成后,我们将 gist 嵌入直接写入模型的嵌入矩阵,并在模型的 tokenizer 中将新的 gist 标记注册为特殊标记。模型在推理时像任何其他模型一样加载和运行:无需自定义注意力掩码、额外的编码器或特殊服务路径。

Gisting 的关键优势在于,模型处理的不是原始提示词的常规摘要,而是一种学习表示,旨在使 LLM 的行为尽可能接近它在看到原始提示词时的行为。

Gisting 可以减少延迟并提高吞吐量。在 Shopify 的案例中,首个标记时间(TTFT)从 438ms 降至 354ms,端到端延迟从 6.8s 降至 4.2s。同时,每秒查询数(QPS)从 20.2 增加到 23.4,使工程团队能够缩减整体 GPU 分配。

最后,Shopify 还强调 Gisting 与其他优化技术(如前缀缓存)是互补的。前缀缓存避免了对缓存提示词序列的 KV 张量进行重新计算,但模型在解码阶段仍需处理这些缓存的张量。Gisting 通过用更短的学习 gist 标记序列替换长提示词,进一步减少了这一开销。因此两种优化是叠加的,Shopify 同时使用两者。

Gisting 的内容远不止本文所能涵盖的。如果您对完整细节感兴趣,请务必阅读原始文章,其中涵盖了 autosearch 在调整 Gisting 过程中的作用,以及其他显著影响性能的实现细节。

AI知识库 / Shopify 推出 Gisting:将 LLM 系统提示词压缩为学习的标记 0 字 0 行 iliuqi
2026-09-04T08:59:38.397783649Z 2026-09-04T09:43:47.479085463Z