本地跑Ornith-1.0-35B:350亿参数能干翻3970亿的Qwen3.5?

AI

大家好,我是老孙。

六月底开源圈出了个新模型——DeepReinforce 发布的 Ornith-1.0 系列。主打 Agentic Coding(智能体编程),主打用强化学习的自改进框架,在同等参数量下把编程能力提升不少。

这段时间也看了不少相关的文章,自己也拉个 Q8_0 的 GGUF 版本本地跑了跑,今天聊聊真实体验。


一、模型基本情况

国内访问:

"https://hf-mirror.com/deepreinforce-ai/Ornith-1.0-35B-GGUF/resolve/main/ornith-1.0-35b-Q8_0.gguf"

Ornith-1.0 不是从零训练的基座,而是在 Qwen3.5 MoE 基础上做的后训练优化,几个关键参数如下:

  • 总参数 35B,MoE 结构 256 选 8,实际激活约 30B
  • 上下文窗口 256K
  • 原生支持工具调用,兼容 OpenAI 格式
  • MIT 许可证,商用无限制
  • GGUF 量化齐全,从 Q2_K 到 Q8_0 都有

核心是它的训练方法:Self-Scaffolding RL(自脚手架强化学习)

通俗点说,以前训练编程模型,都是人先设计好一套固定的解题流程(比如先分析需求、再写测试、再写代码),让模型在这个框架里试错。但人设计的流程不一定适配所有问题。

Ornith 的思路是把"设计解题流程"这件事也交给模型自己学。做题时,它一边生成代码,一边生成针对这道题的脚手架,两者一起接受奖励信号优化。相当于模型在学解题的同时,也在学"怎么解题"。


二、跑分数据怎么看

先放官方给出的基准成绩,客观列出来,大家可以看一下。

基准测试Ornith-1.0-35BQwen3.5-35BQwen3.6-35B
SWE-bench Verified75.6--
Terminal-Bench 2.164.241.4-
SWE-bench Pro50.444.649.5

数据来源:官方模型卡与第三方技术整理

几个客观结论:

  1. 同尺寸对比有明显优势。对比 Qwen3.5/3.6-35B,各项编程基准都有提升,SWE-bench Pro 上小幅领先 Qwen3.6。
  2. 部分测试超越 397B。这个说法主要来自 Terminal-Bench 2.1 单项(64.2 vs 53.5)。不同基准上结论不一样,不能一概而论。
  3. SWE-bench 分数有水分是行业常态。独立研究显示,榜单上约两成"通过"的补丁实际存在语义问题,这是所有模型都面临的问题,不独此一家。

我的看法:这模型确实有东西,35B 档位里属于第一梯队,编程专项可优先选择。


三、本地部署实测

说回大家最关心的:普通显卡能不能跑?速度怎么样?

我测的是 ornith-1.0-35b-Q8_0.gguf,文件体积约 37GB。Q8_0 属于高保真量化,精度损失很小,适合追求效果的场景。

下载方法

curl -L -C - \
  -A "Mozilla/5.0 Chrome/120.0.0.0" \
  -o ornith-1.0-35b-Q8_0.gguf \
  "https://hf-mirror.com/deepreinforce-ai/Ornith-1.0-35B-GGUF/resolve/main/ornith-1.0-35b-Q8_0.gguf"

下载命令示例

显存与速度

Q8_0 版本全量加载大约需要 38-40GB 显存。如果显存不够,可以选 Q4_K_M 量化,约 20GB 就能跑

推理速度方面,单卡消费级显卡上,Q8_0 版本在我的 GPU 跑大概在 60-70 tokens/s 区间

社区也有 MTP(多词元预测)嫁接的优化版本,能提速约 35%,追求速度的可以关注。

速度测试结果


四、实际使用感受

用llama.cpp使用了这个模型,开始测试:

日常文学类测试

让它生成一首诗,看看效果:

诗歌生成测试

感觉还行。主要惊喜还是生成的速度,可以达到72tokens/s,这是我本地部署用过最快的模型了。

编程任务这个模型主要的改善点在编程的能力,那我们结合opencode,看一下它的能力如何。

用llama.cpp server启动服务:

llama.cpp server启动

在opencode中配置本地这个模型,让它生成一个坦克大战的游戏:

opencode配置

坦克大战生成过程

看log,速度在70tokens/t

日志显示速度

但GPU占了快100%,极限了。

程序生成到一半,生成代码被截断,决定用更小块输出。

最后agent决定生成了最简单的程序,过了10分钟,说是做完了。

简化程序结果

最后完成效果如下:

最终游戏效果

体验了一下,bug比较多,玩玩就卡死。


五、总结与建议

最后给个明确的结论,省得大家纠结。

整体来说,Ornith-1.0-35B 是个本地可用的编程类模型,我觉得只能给出代码段级的程序。工程级的程序基本是不太可能。平常使用的话,还是用在线版本的GLM5.2与Kimi2.6和DeepSeekV4 Pro靠谱。这个就是玩票性质。

我是程序员老孙,专注 AI 相关技术,有问题欢迎在评论区讨论。