开源项目推荐:Strata —— 1250 亿参数大模型,在你家游戏 PC 上跑

开源项目推荐:Strata —— 1250 亿参数大模型,在你家游戏 PC 上跑

一句话:把通常要服务器集群才能跑的 Qwen3.8-Flash-Next(125B),塞进一张 12GB 显存的游戏显卡里,还给你 OpenAI 兼容接口。

GitHub:Niko1221/Strata | ⭐ 12.5k | Fork 1.1k | MIT 协议

家用游戏 PC 跑 125B 大模型概念图(AI 配图)
家用游戏 PC 跑 125B 大模型概念图(AI 配图)

它是什么?解决什么问题?

125B 参数的模型,正常理解是”租卡吧,一张 H100 一小时几十块”。Strata 干的是反常识的事:让它在你家 RTX 5070 / RX 9070 XT 这种消费级显卡上跑起来,聊天、写代码、看图都行,数据不出你家 PC,还顺手给你 localhost:8080 的 OpenAI / Anthropic 兼容 API——Claude Code、Cursor、Codex 全能接。

原理一句话(官方”厨房论”):模型是 24576 个小专家组成的团队,每个词其实只需要其中 10 个。于是常用的专家放台面(显存),全部专家放 pantry(内存),再配一张 SSD 上的检索表,CPU/GPU/内存/硬盘四件套一起上。再加”小模型先猜、大模型批量验”(speculative decoding,同答案快 1.6–1.8 倍)和 8K token 一块读的预填充,速度就起来了。

核心优势:数字说话

1. 速度:5070 上 94 token/s,比你读得快

官方实测(RTX 5070 12GB,短回答场景):

量化档 写回答 读提示(32K 文档)
Q2_0 94 tok/s 2650 tok/s
IQ2_XS 79 tok/s 2090 tok/s
IQ3_S(最准) 53 tok/s 1620 tok/s

60 tok/s 就超过人类阅读速度。显存更大的卡更快:RTX 3090 24GB 能到 100–140 tok/s 写回答。

2. 安装:双击 bat,剩下交给它

Windows 双击 START-HERE.bat,Linux 跑 ./setup.sh:自动识别 N 卡/A 卡、问你内存选档、拉约 70GB 模型(断点续传)、打开浏览器 127.0.0.1:8080。懒人终极版:把仓库里那句 prompt 扔给你的 AI 编程助手,让 AI 替你装,装完还能通过 MCP 服务器启停 Strata。

3. 选型表:内存多大办多大事

内存 拿哪个档
32GB Coder(代码特化,SWE-bench 达完整版 91%,但中文弱,CJK 需求选 Q2_0/IQ2_XS)
48GB IQ2_XS(或最快的 Q2_0)
64GB IQ2_XS 起步,IQ3_S 最准
96GB+ IQ3_S,或 Unsloth 4-bit 版

4. 接口:本地就是云

  • OpenAI 兼容:http://127.0.0.1:8080/v1(Key 和模型名随便填);
  • Anthropic 兼容:/v1/messages,Claude Code 一行环境变量就切过来;
  • Codex Responses API 也有;浏览器里还有 Chat + 实时 Monitor(GPU/CPU/内存状态)+ 图片输入。
Monitor 实时监控 + 编程 Agent 写体素宝塔(仓库官方实拍,5070、50tok/s、显存 11.2/12GB)
Monitor 实时监控 + 编程 Agent 写体素宝塔(仓库官方实拍,5070、50tok/s、显存 11.2/12GB)

5. 网友实测背书:RTX 5070 一发写体素宝塔

README 置顶就是社区实拍:5070 上 IQ3_S、128K 上下文,一句话 prompt 生成体素宝塔花园,还有 49 秒完整视频。不是跑分截图,是真干活。

体素宝塔花园:5070 一句话生成(官方动图,点击看 49 秒完整视频)

网友实测:RTX 5070 上 IQ3_S 一句话写出体素宝塔(仓库官方动图,流量注意)。

门槛和边界(先看再下 70GB)

  • 硬件:12GB+ 显存显卡(20/30/40/50 系或指定 A 卡)、32GB+ 内存、约 80GB SSD 空间,Win10/11 或 Linux;
  • 首次启动卡 1–3 分钟是正常的(往内存锁 35–55GB),别关窗口;
  • 慢 + 爆盘灯狂闪 = 内存不够,关浏览器或换小档;
  • Coder 档中文弱、AMD 在 Windows 下还不能看图、混杂多语有短板——玩之前先看 docs/ 里对应的说明;
  • 模型本体另有授权(Qwen 系),商用前看一眼。

结语

本地大模型的分水岭早就不是”能不能跑”,而是”跑得像不像云”。Strata 的答案是:把 125B 塞进游戏 PC,再用一套兼容接口抹掉本地和云的区别。12.5k Star,投的是这一票。

仓库:github.com/Niko1221/Strata(MIT)。动手前先对着”内存选型表”看一眼,别下错档。

Comments

No comments yet. Why don’t you start the discussion?

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注