本地跑Ornith-1.0-35B:350亿参数能干翻3970亿的Qwen3.5?
大家好,我是老孙。
六月底开源圈出了个新模型——DeepReinforce 发布的 Ornith-1.0 系列。主打 Agentic Coding(智能体编程),主打用强化学习的自改进框架,在同等参数量下把编程能力提升不少。
这段时间也看了不少相关的文章,自己也拉个 Q8_0 的 GGUF 版本本地跑了跑,今天聊聊真实体验。
一、模型基本情况
国内访问:
"https://hf-mirror.com/deepreinforce-ai/Ornith-1.0-35B-GGUF/resolve/main/ornith-1.0-35b-Q8_0.gguf"
Ornith-1.0 不是从零训练的基座,而是在 Qwen3.5 MoE 基础上做的后训练优化,几个关键参数如下:
- 总参数 35B,MoE 结构 256 选 8,实际激活约 30B
- 上下文窗口 256K
- 原生支持工具调用,兼容 OpenAI 格式
- MIT 许可证,商用无限制
- GGUF 量化齐全,从 Q2_K 到 Q8_0 都有
核心是它的训练方法:Self-Scaffolding RL(自脚手架强化学习)。
通俗点说,以前训练编程模型,都是人先设计好一套固定的解题流程(比如先分析需求、再写测试、再写代码),让模型在这个框架里试错。但人设计的流程不一定适配所有问题。
Ornith 的思路是把"设计解题流程"这件事也交给模型自己学。做题时,它一边生成代码,一边生成针对这道题的脚手架,两者一起接受奖励信号优化。相当于模型在学解题的同时,也在学"怎么解题"。
二、跑分数据怎么看
先放官方给出的基准成绩,客观列出来,大家可以看一下。
| 基准测试 | Ornith-1.0-35B | Qwen3.5-35B | Qwen3.6-35B |
|---|---|---|---|
| SWE-bench Verified | 75.6 | - | - |
| Terminal-Bench 2.1 | 64.2 | 41.4 | - |
| SWE-bench Pro | 50.4 | 44.6 | 49.5 |
数据来源:官方模型卡与第三方技术整理
几个客观结论:
- 同尺寸对比有明显优势。对比 Qwen3.5/3.6-35B,各项编程基准都有提升,SWE-bench Pro 上小幅领先 Qwen3.6。
- 部分测试超越 397B。这个说法主要来自 Terminal-Bench 2.1 单项(64.2 vs 53.5)。不同基准上结论不一样,不能一概而论。
- SWE-bench 分数有水分是行业常态。独立研究显示,榜单上约两成"通过"的补丁实际存在语义问题,这是所有模型都面临的问题,不独此一家。
我的看法:这模型确实有东西,35B 档位里属于第一梯队,编程专项可优先选择。
三、本地部署实测
说回大家最关心的:普通显卡能不能跑?速度怎么样?
我测的是 ornith-1.0-35b-Q8_0.gguf,文件体积约 37GB。Q8_0 属于高保真量化,精度损失很小,适合追求效果的场景。
下载方法
curl -L -C - \
-A "Mozilla/5.0 Chrome/120.0.0.0" \
-o ornith-1.0-35b-Q8_0.gguf \
"https://hf-mirror.com/deepreinforce-ai/Ornith-1.0-35B-GGUF/resolve/main/ornith-1.0-35b-Q8_0.gguf"

显存与速度
Q8_0 版本全量加载大约需要 38-40GB 显存。如果显存不够,可以选 Q4_K_M 量化,约 20GB 就能跑
推理速度方面,单卡消费级显卡上,Q8_0 版本在我的 GPU 跑大概在 60-70 tokens/s 区间
社区也有 MTP(多词元预测)嫁接的优化版本,能提速约 35%,追求速度的可以关注。

四、实际使用感受
用llama.cpp使用了这个模型,开始测试:
日常文学类测试
让它生成一首诗,看看效果:

感觉还行。主要惊喜还是生成的速度,可以达到72tokens/s,这是我本地部署用过最快的模型了。
编程任务这个模型主要的改善点在编程的能力,那我们结合opencode,看一下它的能力如何。
用llama.cpp server启动服务:

在opencode中配置本地这个模型,让它生成一个坦克大战的游戏:


看log,速度在70tokens/t

但GPU占了快100%,极限了。
程序生成到一半,生成代码被截断,决定用更小块输出。
最后agent决定生成了最简单的程序,过了10分钟,说是做完了。

最后完成效果如下:

体验了一下,bug比较多,玩玩就卡死。
五、总结与建议
最后给个明确的结论,省得大家纠结。
整体来说,Ornith-1.0-35B 是个本地可用的编程类模型,我觉得只能给出代码段级的程序。工程级的程序基本是不太可能。平常使用的话,还是用在线版本的GLM5.2与Kimi2.6和DeepSeekV4 Pro靠谱。这个就是玩票性质。
我是程序员老孙,专注 AI 相关技术,有问题欢迎在评论区讨论。