圖片生成
這是什麼
把文字指示或既有圖片交給可替換的圖片模型,產生或編輯圖片並回傳結果的工具能力。
白話解釋
Hermes 不會只靠文字「畫」出圖片,而是替你委託真正的圖片生成模型。你可以交付文字需求,或提供既有圖片並說明要改什麼;Hermes 會把工作送到所選模型,再回傳完成的圖片。背後選用哪位「畫家」屬於設定,不需要改寫提問方式。
為什麼重要
圖片供應商可透過設定切換,不必修改程式碼;fal、openai、openrouter、xai 與 krea 都以獨立、可插拔的 image_gen 後端接在同一工具集後面。圖片生成和視覺理解、影片生成彼此相關但用途不同:一個產生圖片、一個解讀圖片、一個把同類能力延伸到動態內容。生成圖片通常比文字回應昂貴,因此重視成本的工作流程多半按需啟用,而不會讓每個工作階段常駐使用。
運作方式
image_generate 是單一工具,但它會讀取目前模型宣告的能力,依啟用的後端調整自身說明(tools/image_generation_tool.py)。使用內建路徑時,它透過 FAL.ai 呼叫 FLUX 2、Nano Banana Pro、GPT-Image、Ideogram、Krea 等模型;在設定中指定 image_gen.provider 後,同一呼叫會改送到 plugins/image_gen/ 下的 OpenAI、OpenRouter、xAI、Krea,或經 Codex 使用 OpenAI 的外掛程式。未提供 image_url 時會生成新圖;傳入 image_url,以及部分模型支援的多張參考圖片時,則會改編既有圖片。無法編輯圖片的模型會直接拒絕這些欄位。部分 FAL 模型還可在完成後額外執行 Clarity Upscaler。
具體範例
小店老闆先請 Hermes 產生商標概念,再要求移除所選版本的背景。第一次呼叫 image_generate 只提供文字指示,因此回傳新生成的商標;第二次呼叫則把同一張圖放入 image_url,並要求「把背景改成透明」。同一工具因收到圖片而切換成編輯模式,結果會是原商標的修改版本,而不是毫無關聯的新圖。
如何連結
「圖片生成」屬於「工具」系列。最直接相關的概念包括:「視覺」、「影片生成」、「代理執行環境」、「個人作業系統」。
來源證據
vendor/hermes-agent/toolsets.py#<file>—toolsets.py的結構性來源對應;此檔位於工具、工具集與 MCP 架構中的工具登錄與工具集核心結構。
工作流程
- 目前尚無第一輪工作流程對應;此概念仍透過文章與來源證據出現在知識庫圖譜中。
相關文章
- 目前沒有文章以足夠頻率直接提及此概念名稱或別名,尚未達到提及探勘門檻。
