執行期

模型呼叫

Hermes 將建構好的上下文發送給所選模型提供者的時刻。

概念專屬圖版模型呼叫hx-graph-context-concept-model-call正在載入視覺預覽…
以原始尺寸檢視

模型呼叫

這是什麼

Hermes 將已建構的上下文交給所選模型提供者,並開始接收回覆的明確交界點。

白話解釋

就像把信投入郵筒:你不必知道是哪輛卡車、飛機或快遞員把它送到目的地,只要封好信封投入即可。模型呼叫就是這個交接點;Hermes 把收集的內容打包送給目前作用中的 AI 提供者,對話迴圈其他部分不必知道實際承運者。

為什麼重要

對話上下文建構出的歷史、記憶、工具與護欄,最後都匯聚成送往目前提供者的一次請求,無論提供者在本機或遠端。明確保留這條邊界,才能只改路由設定就替換提供者,不必修改對話迴圈。重試與備援邏輯也特別關注這一步,因為提供者逾時與速率限制會先在此顯現。

運作方式

對話迴圈準備呼叫模型時,build_api_kwargsagent/chat_completion_helpers.py)會組合實際請求,包括訊息、工具、token 上限與推理設定,並依作用中的傳輸方式調整成 OpenAI 風格的 chat completions、Anthropic 原生 Messages APIAWS Bedrock Converse APICodex Responses 風格。送出前,請求中介層可先重寫請求;接著觸發 pre_api_request 外掛程式掛鉤,這時只能觀察最終請求,不能再修改(agent/conversation_loop.py)。即使沒有介面需要即時文字,Hermes 仍偏好串流回覆,因為串流可用 stale-stream timer 與讀取逾時做細緻健康檢查,比單純阻塞請求更早偵測已無回應的連線。

具體範例

使用者原本以 OAuth 驗證的 Anthropic 連線使用 Claude,專案進行中改把基礎 URL 指向本機 llama.cpp 伺服器。對話迴圈仍組合相同歷史與工具清單;只有模型呼叫改建 OpenAI 風格參數並連到新端點。使用者只會看到回覆改由本機模型產生,這個請求建構步驟之前的流程都不需改動。

如何連結

「模型呼叫」屬於「執行期」系列。最直接相關的概念包括:「對話輪次終結器」、「重試與備援」、「個人作業系統」。這些連結描述教學關係,不取代來源證據。

來源證據

  • run_agent.py#run_agent.AIAgent — 精確符號對應;已對照釘選版本驗證。

工作流程

  • 目前尚無第一輪工作流程對應;此概念仍透過文章與來源證據出現在知識庫圖譜中。

相關文章

相關筆記