營運

本機模型

透過 LM Studio 或 Ollama 等工具在本機託管的模型。

概念專屬圖版本機模型hx-graph-context-concept-local-models正在載入視覺預覽…
以原始尺寸檢視

本機模型

這是什麼

讓使用者自己託管推理服務,使選定工作可由電腦上的模型完成,不必送往遠端提供者。

白話解釋

執行本機模型有點像在家沖咖啡,不必到咖啡館購買:廚房裡隨時可用,沒有逐杯費用也不用排隊,但家用設備未必能提供咖啡館的完整選擇。本機模型讓 Hermes 在不把請求送離電腦的情況下推理。

為什麼重要

透過 LM StudioOllama 類型的伺服器,本機模型完全不必把提示送到託管提供者;代價是可在本機執行的模型與前沿託管模型之間可能有能力差距。成本控制與隱私需求都可能促使使用者採用本機模型:沒有逐次呼叫費用,資料也不離機。提供者切換則讓每項工作可混用本機與託管模型,不必做全有或全無的選擇。

運作方式

Hermes 透過提供者別名連接本機模型伺服器,方式和連接託管 API 相同。LM Studio 有內建覆寫層,預設使用 http://127.0.0.1:1234/v1;若連接埠不同,可用 LM_BASE_URL 覆寫(hermes_cli/providers.py)。單獨使用 ollama 會在內部映射到通用 custom 提供者,而 vllmllama.cpp 會映射到虛擬 local 提供者;三者都會使用使用者設定的端點,而不是託管模型目錄項目(hermes_cli/providers.py)。通用提供者背後的外掛程式將自己描述為Custom / Ollama / local OpenAI-compatible endpointplugins/model-providers/custom/plugin.yaml),因為任何在 localhost 提供 OpenAI chat-completions 相容介面的伺服器都可使用。

具體範例

你在桌上型電腦安裝 Ollama,並在夜間下載一個小型開放權重模型。隔天把 Hermes 提供者設為 ollama,Hermes 便將該別名解析為指向本機連接埠的 custom 提供者。之後一批例行檔名整理請求完全由桌上型電腦上的模型回答,不會送到外部公司的伺服器,也不產生逐次呼叫帳單。

如何連結

「本機模型」屬於「營運」系列。最直接相關的概念包括:「模型提供者」、「提供者切換」、「代理執行環境」、「個人作業系統」。這些連結描述教學關係,不取代來源證據。

來源證據

  • run_agent.py#run_agent.AIAgent — 精確符號對應;已對照釘選版本驗證。

工作流程

  • 目前尚無第一輪工作流程對應;此概念仍透過文章與來源證據出現在知識庫圖譜中。

相關文章

相關筆記