我一直在问自己同一个问题:我的显卡到底能不能跑这个模型?
不是理论上,而是实际上。我有一张 RTX 4090,想跑 Llama 3.3 70B。需要再买一张卡吗?该妥协用 Q4 量化吗?把上下文窗口拉到 32K 还能装得下吗?
用搜索引擎找到的不是答案互相矛盾的 Reddit 帖子,就是只能告诉你一半信息的计算器。有个叫 llmfit 的 CLI 其实做得不错——GitHub 上 29k 颗星——但它运行在你的机器上,只能告诉你这台机器能干什么。如果你还在纠结该买什么卡,它帮不上忙。
所以我做了一个能帮上忙的工具。
GPU Fits 是干什么的
三个工具,全部在浏览器里运行,无需安装。
显存计算器
选一个模型,选一个量化级别(Q4_K_M、Q6_K、FP16 等),拖动上下文长度滑块。它会把显存占用拆成三根条形图:权重、KV cache 和系统开销。KV cache 这部分比较有意思——我不得不分别处理标准的 GQA 模型和 DeepSeek-R1 这样的 MLA 模型,因为后者对 cache 的压缩太狠了,用标准公式会高估好几个数量级。
GPU 兼容性检查器(双向)
这是我自己用得最多的一个。两种模式:
- 模型 → GPU:”我想用 Q4 量化、8K 上下文跑 Qwen3 32B——哪些卡能胜任?”单卡、多卡都行。它会按”宽松(≤80% 显存)”、”紧张(≤100%)”或”需要多卡”来排序。
- GPU → 模型:”我有一张 4090——能舒服地跑的最大模型是哪个?”或者”我有两张 3090——怎么组合才能装得下?”
上下文长度会改变答案,而这恰恰是大多数对照表忽略的部分。
本地部署 vs API 成本计算器
诚实的那个。输入你预期的每月 token 用量,它会告诉你买硬件相比调 API 是否划算。它不会默认”本地永远更划算”——有时候确实不划算,工具会直说。如果算下来 API 更便宜,它会告诉你盈亏平衡点在第几个月。不带立场,只有数字。
还是那套”无聊”的技术栈
和 NZ Pathway 一样:Astro 4、Tailwind、静态 HTML。我把移民项目的骨架复制过来,剥离了所有新西兰相关的内容。i18n 流水线、Cloudflare Pages 部署和 SEO 配置都是经过实战检验的,所以这次做得更快。
整个网站是双语的(英文 + 中文),因为玩本地 LLM 的人本来就横跨这两个生态圈。
有件事一点也不无聊:网站会自动生成 138 个组合页面,比如”RTX 4090 能跑 Llama 3.1 70B 吗?”每个页面都是真实计算出来的数字,不是复制粘贴的文案。也就是 138 × 2 种语言 = 276 个页面,全是静态 HTML,部署时由一个 12×12 的模型×GPU 矩阵生成。思路是抓住那些没人专门写内容的长尾搜索词。
目前进展
所有功能都完成了,总共 313 个页面。20/20 个测试向量全部通过(我给显存计算公式写了单元测试,因为这东西算错了还不如干脆没有计算器)。数据层覆盖 12 个模型、12 款 GPU、7 个量化预设,以及 7 家 API 服务商的定价。
域名买好了,Cloudflare Pages 配置完毕,网站已经上线。
规矩和上个项目一样:工具优先,信任其次,广告随缘。我依然不会假装自己是别的什么——每个页面都有免责声明,说明这些只是估算而非保证,数字还是要自己核实。
**已上线:gpufits.com。**如果你也体会过那种”我的显卡到底装不装得下 70B 模型”的纠结,这个工具可能对你有用。