上下文壓縮
這是什麼
Hermes 在對話歷史達到上下文限制時,如何透過摘要、移除與重塑來壓縮。
白話解釋
想像你正在和一張便利貼進行對話——一旦寫滿了,你就得決定哪些內容真正重要,將其轉寫到一張新的便利貼上,然後繼續。這就是 Hermes 上下文壓縮的本質:當對話達到 AI 模型的上下文視窗上限時,Hermes 不會直接崩潰或忘記開頭說了什麼,而是聰明地將對話歷史壓縮成精簡摘要,讓你順暢地繼續。
為什麼重要
AI 模型在上下文視窗內運行——它們能「看到」的輸入量是有限的。在長對話中,較早的內容可能會被截斷,導致代理失去對關鍵細節的追蹤。良好的壓縮確保重要的脈絡得以保留,同時拋棄冗餘的細節,使長時間的工作階段保持有效。
運作方式
Hermes 監控對話的 token 使用量。當使用量接近模型上下文限制時,它會觸發壓縮流程。較舊的訊息會摘要為較短的形式,保留關鍵事實和決策,同時移除對話性的內容。被摘要或移除的訊息會從活躍上下文中移除,但可以選擇性地存檔在 vault 中以供後續查詢。壓縮策略可以設定——你可以偏好更積極的壓縮以延長對話,或更保守的方式以保留更多細節。
具體範例
你正在進行一個為期三小時的編碼工作階段。
- 前兩小時充滿了探索性對話——嘗試不同方法、除錯輸出、來回討論。
- 當上下文使用量達到 75% 時,Hermes 開始壓縮較舊的互動。
- 具體的除錯錯誤訊息會被摘要化;已解決的方法被濃縮為一行註記。
- 重要決策——「我們選擇 PostgreSQL 而非 MongoDB」——仍保留在摘要中。
- 你可以在不喪失脈絡的情況下繼續編碼數小時。
如何連結
本筆記屬於執行環境系列。最鄰近的概念包括:對話循環、工作階段狀態、代理執行環境。
來源證據
compression.py#ContextCompressor— 分析並壓縮對話歷史的壓縮器。compression.py#SummarizationStrategy— 決定如何摘要對話的可設定策略。
工作流程
- 尚無首次工作流程對應;此概念仍透過文章與來源證據存在於筆記庫圖譜中。
相關文章
- 目前暫無文章以此概念名稱或別名達到引用門檻(請參閱提及-挖掘政策)。