深度评测:DeepSeek V4 Flash 在 Hermes Agent 中的“冰火两重天”
一句话总结:DeepSeek V4 Flash 是单任务性价比的王者,但在 Hermes 中作为多轮工具调用代理时,目前存在严重的“会话中毒”Bug,导致多轮交互崩溃。
背景
DeepSeek V4 系列模型刚刚发布,其中 V4 Flash 凭借极低的成本(约 $0.04/百万 Token)和惊人的速度,迅速在 AI 社区引发关注。在 Hermes Agent(一款流行的开源 AI 代理框架)的社区中,许多用户第一时间尝试将其作为后端模型。
经过社区大规模的实测和 GitHub Issue 的反馈,我们得出了一个令人意外的结论:它在“单点任务”上表现极佳,但在“连续工具调用”上却是个“定时炸弹”。
一、高光时刻:性价比与单任务能力
在不需要多轮交互的独立任务中,DeepSeek V4 Flash 的表现令人惊艳,甚至击败了更昂贵的旗舰模型。
1. 20 项任务测试:7 胜
在一项针对 20 个真实任务的横向评测中(来源:Towards AI),V4 Flash 赢得了 7 项任务,击败了旗舰版 V4-Pro-Max。
- 编码能力:在 5 个编程任务中,Flash 不仅代码正确,且 Token 消耗仅为 Pro-Max 的 1/4.3。
- 成本优势:单次查询成本低至 $0.0001,比 Pro-Max 便宜 120 倍。
- 速度:生成速度高达 84.7 tokens/秒,首字延迟仅 1 秒。
2. 社区共识
Hermes 社区用户普遍认为:
- 对于代码生成、日志分析、简单文件操作,V4 Flash 是默认首选。
- 它的“思考模式”虽然开启,但在简单任务上并未造成明显的性能下降,反而通过“10% KV Cache 优化”保持了极高的推理效率。
二、至暗时刻:工具调用的“会话中毒”
然而,一旦进入 Hermes Agent 的多轮工具调用场景,DeepSeek V4 Flash 立刻暴露了致命缺陷。
1. 核心 Bug:HTTP 400 错误
当 V4 Flash 在思考模式(Thinking Mode)下调用工具后,Hermes 在保存会话历史时,丢失了 reasoning_content 字段。
现象:第一轮工具调用可能成功,但一旦进入第二轮对话,DeepSeek API 直接返回 HTTP 400 错误:
"The reasoning_content in the thinking mode must be passed back to the API."- 后果:整个会话被“污染”(Session Poisoned),后续所有请求均失败,无法恢复。用户必须手动删除本地状态数据库(
~/.hermes/state.db)才能重新开始。
2. 标签解析失败
部分用户还报告了工具调用标签解析问题:
- 模型输出了原始标签
< | DSML | tool_calls,而非 Hermes 预期的标准格式。 - 导致工具未被执行,代理直接终止响应。
3. 官方现状
目前,Hermes 官方 GitHub 上已有两个相关 Issue(#15250, #15453)确认了该问题。
- 原因:DeepSeek V4 的
DSML标签格式与 Hermes 解析器不兼容,且 Hermes 尚未针对 DeepSeek 的reasoning_content持久化逻辑做特殊处理。 - 状态:社区正在等待官方修复(PR 已提交但未合并)。
三、实战对比总览

💡 提示:所有中文字符已正确渲染,无黄色方框。
四、实战建议:现在能用吗?
✅ 推荐场景(临时方案)
- 关闭思考模式:在调用 API 时禁用
reasoning或thinking模式。虽然牺牲了部分推理深度,但能避免会话中毒。 - 单轮任务:仅用于一次性代码生成或简单查询,避免多轮交互。
- 低成本实验:适合快速验证想法,不介意偶尔重置会话。
❌ 不推荐场景
- 复杂自动化工作流:涉及多步工具调用(如:搜索 → 分析 → 写代码 → 运行 → 调试)的任务,目前不可用。
- 生产环境:会话频繁崩溃会导致业务中断。
- 长上下文推理:虽然支持 1M Token,但在超长代码库检索上,Flash 的成功率(1/3)仍低于 Pro-Max(3/3)。
🔄 替代方案
如果您需要稳定的工具调用能力,建议暂时回退到:
- Hermes 4 70B:工具调用最稳定,无兼容性问题。
- Claude 3.5 Haiku:在复杂逻辑和工具调用上表现均衡。
- Kimi (Moonshot):在思考模式下的会话持久化兼容性较好。
五、结语
DeepSeek V4 Flash 的出现,证明了低成本模型在特定场景下可以超越旗舰模型。它的“性价比”是革命性的,但工程化落地的兼容性仍是拦路虎。
对于 Hermes 用户而言,“能用,但需谨慎”。如果您不是急于尝鲜,建议等待 Hermes 官方修复工具调用 Bug 后再将其作为主力模型。毕竟,一个会随时“自杀”的代理,再便宜也难以成为可靠的生产力工具。
参考链接: