Article
自架無審查 DeepSeek V4 Flash 實測指南:地端 Agent 終極大腦
💡 核心定義:什麼是無審查 (Uncensored / Abliterated) DeepSeek V4 Flash?
由開源社群的大神們透過特化演算法消除模型內建的思想鋼印與安全過濾拒絕,保留盡可能多的邏輯推理與工具呼叫 (Tool Calling) 能力。在地端搭配 128GB 顯存/統一記憶體與 DS4 專用載入框架,展現出思考簡短、預載入較快且極少發魔跳針的 Agent 大腦性能。
在自架地端 AI Agent 的世界裡,許多人常陷入一個誤區:「模型參數越大多模態越好,或者 35B / 70B 的思考越長越聰明」。
本以為這模型沒法日常使用,但做完真實 Agent 場景測試後發現:自架「無審查 DeepSeek V4 Flash」比 Qwen 3.6 35B 更適合做日常 Agent 大腦!
這篇文章直接引據 最新地端實測數據,完整拆解自架無審查 DeepSeek V4 Flash 的硬體門檻、模型版本、預載入與思考速度實測對比,以及為何它能顯著改善地端 Agent 工具調用 (Tool Calling) 瞎做跳針的痛點。
一、主推模型:apetersson/DeepSeek-V4-Flash-0731-Abliterated-DS4-Headroom128
在地端自架 DeepSeek V4 Flash 時,選擇合適的模型版本相當關鍵。如果直接載入官方版,除了帶有思想鋼印與過濾攔截外,也可能無法直接套用在部分專用框架上。
🌟 目前測試的模型
apetersson/DeepSeek-V4-Flash-0731-Abliterated-DS4-Headroom128
- 版本亮點:這是我目前找到能順利搭配 DS4 框架運行的版本。它具備 Abliterated(去鋼印/無審查) 特性,解除了模型在回答敏感技術或特定安全指令時的過濾拒絕,並且能直接在 DS4 專用框架上加載。
- 適用場景:專門為 OpenClaw、Antigravity、n8n 等需要頻繁進行複雜 SKILL 調用與自動化任務的 Agent 設計。
二、真實 Agent 場景速度與顯存實測 (最新數據)
在真實 Agent 使用場景中,對話上下文常態開 3 萬 ~ 5 萬 Token,像 OpenClaw 這類工具的第一句話載入長度至少 2 萬 Token 起跳。
在這種高強度上下文加載下,參考 apetersson 於 NVIDIA 論壇分享的討論 以及地端框架實測:
| 測試指標 | DeepSeek V4 Flash 實測數據 | Qwen 3.6 35B 對照組 | 結論與優勢 |
|---|---|---|---|
| 預加載速度 (Pre-fill) | 800 ~ 900 Token/s ⚡ | 400 ~ 500 Token/s | V4 快將近一倍,首響加載較快 |
| 推理生成速度 (Gen Speed) | 1x ~ 2x | 4x ~ 8x | Qwen 字數輸出快,但 V4 思考短總耗時更少 |
| 思考過程 (Thinking) | 精準、簡短 | 像寫小說 (字數高達 V4 的 6 倍!) | Qwen 光思考就耗光時間還拖慢完成速度 |
| 工具呼叫 (Tool Calling) | 4 次有 3 次主動調用 SKILL 🎯 | 無視 SKILL 直接瞎做 | V4 調用較穩定,服從度高 |
⚠️ 顯存與框架配置建議:
64GB 顯存根本裝不進去!顯存至少需要 96GB(例如 RTX PRO 6000)或 128GB 以上統一記憶體(如 GB10 / DGX Spark 或 Mac M5 128GB),並搭配 DS4 專用啟動框架進行載入。
三、為什麼 DeepSeek V4 Flash 比 Qwen 3.6 35B 更適合做 Agent 大腦?
在過去的測試中,為了讓 Qwen 3.6 35B 能乖乖調用 SKILL 工具,我拼命調整 Prompt 提示詞,但 35B 常無視規範直接瞎做。換成無審查版 DeepSeek V4 Flash 後,產生了兩個體驗轉變:
1. 思考內容精準簡短,不寫小說拖時間
Qwen 3.6 35B 在思考時常常像在「寫小說」,Thinking 過程長篇大論,思考字數居然高達 DeepSeek V4 的 6 倍!
就算 Qwen 35B 的推理生成速度看似較快(4x ~ 8x),但光是漫長無意義的思考就把時間全耗光了,導致整體任務完成時間反而拖慢。反觀 DeepSeek V4 的思考邏輯較為精準、簡短直接。
2. SKILL 工具調用 (Tool Calling) 表現穩定、顯著減少瞎做
在同一個系統指令下測試 4 次任務:
- DeepSeek V4 Flash:4 次當中有 3 次會主動且精準地調用 SKILL 工具,完全不用費心微調。
- Qwen 3.6 35B:無視 SKILL 規範,直接瞎做。
DeepSeek V4 Flash 在接到指令後,看完 SKILL 規範會繼續調用工具做事,用到一半中途回報進度,然後繼續執行直到做完。
四、自架無審查模型的核心價值:隱私與無鋼印
很多人會問:「用官方 API 便宜又省事,為什麼要花大錢買大顯存電腦自架?」
我算過一筆帳:按照官方 API 的計價,你要調用超過 9.8 兆 Token 才能把一台大顯存硬體的錢賺回來。因此:如果你單純只是為了『省錢』,直接呼叫官方 API 即可。
但我們選擇自架,追求的是:
- 完整資料隱私與掌控:所有商業密碼、個人筆記與 Agent 記憶庫完全留在本地。
- 無思想鋼印與無道德審查:不會遇到模型突然跳出「身為一個 AI 助手,我無法回答…」的拒絕回應。
- 離線斷網可活:即使斷網或官方 API 故障,你的地端 Agent 團隊依舊正常運作。
想了解更多關於地端模型系統架構與防護,可以參考我的前作 《地端 AI 模型總是跳針?你其實只差在沒給它套上 Harness!》。
五、常見問題 FAQ
Q1:自架無審查 DeepSeek V4 Flash 適合用在哪些情境?
最適合用在需要高強度工具呼叫 (Tool Calling)、複雜語意理解與自動化 Agent 工作流的情境(例如搭配 OpenClaw、Antigravity、n8n 打造個人數位助理)。不適合用來處理多模態(圖片/影片識別)任務,多模態建議搭配其他專用模型。
Q2:64GB 顯存跑得動嗎?顯存需求是多少?
64GB 顯存根本裝不進去! 顯存至少需要 96GB(例如 RTX PRO 6000)或 128GB 以上統一記憶體(GB10 / Mac M5 128GB)才能載入運作。
Q3:為什麼選 apetersson/DeepSeek-V4-Flash-0731-Abliterated-DS4-Headroom128?
單純是因為這是我目前找到能搭配 DS4 框架運作的無審查模型,不代表它是最佳選擇,更不是什麼性能天花板,後續仍有待開源社群持續開發與優化。
💡 總結與延伸資源
自架無審查 DeepSeek V4 Flash 證明了一件事:在 Agent 的實戰場景中,『思考精準』與『工具調用服從度』遠比單純的推理字數速度更重要!
如果你手頭有 128GB 以上的大顯存設備,非常推薦親自下載 apetersson 特化版本進行測試。
- 🔗 延伸閱讀:《地端 AI 模型總是跳針?你其實只差在沒給它套上 Harness!》
- 🔗 延伸閱讀:《桌面 AI 助理 DIY:榨乾 Google 免費額度,打造專屬幫手》
- 🔗 延伸閱讀:《手把手教你:申請免費 Google Gemini API》
- 🤝 想要建置企業級自動化 Agent 工作流?歡迎預約 n8n 認證陪跑課 或聯繫 專屬諮詢與合作洽談。