本地模型
這是什麼
透過 LM Studio 或 Ollama 等工具在本機託管的模型。
白話解釋
執行本地模型有點像在家裡自己煮咖啡,而不是走去咖啡館買一杯:廚房裡就有,不用每次付費,也不用排隊等待,但你桌上的設備無法完全媲美咖啡館的完整品項。本地模型讓 Hermes 可以在不讓任何請求離開你機器的情況下進行推理。
為什麼重要
透過 LM Studio 或 Ollama 之類的伺服器提供服務,本地模型讓 Hermes 可以在完全不將提示傳送給託管提供者的情況下執行,代價是本機可執行模型與前沿託管模型之間的能力差距。當利害關係證明合理時,成本控制和隱私保護都會傾向於這個選擇:沒有按次計費,沒有資料離開機器。提供者切換功能使得混合使用本地和託管模型成為每個任務的實用選擇,而非全有全無的決定。
運作方式
Hermes 對待本地執行的模型伺服器的方式,與對待任何託管 API 完全一樣——透過一個提供者別名。LM Studio 有一個內建覆蓋層,預設為 http://127.0.0.1:1234/v1,並讀取 LM_BASE_URL 覆蓋值(如果你更改了埠號)(hermes_cli/providers.py)。裸 ollama 引用會映射到 Hermes 預先配置的 Ollama 提供者項目中。如果啟用了多個提供者,聊天迴圈(agent/conversation_loop.py)會在建構 API 引數之前將目前的提供者解析為其 API 金鑰和端點——因此只要模型伺服器正在執行,所有路由、記憶體和工具邏輯都保持不變。