Qwen3.8-27B本地实测:3090、4090与5090怎么选
Qwen3.8-27B的本地部署,关键不只是显卡能否装下模型,还要看量化格式、MTP加速和实际任务类型。本文对比RTX 3090、4090与5090的显存门槛、生成速度和使用体验。
对于想在本地运行大模型的人来说,27B是一个很有意思的档位。
7B、8B模型容易部署,响应也快,但面对复杂代码、长文档分析和多步骤任务时,能力往往不够稳定。70B级别模型能力更强,却通常需要多张显卡,或者接受明显的CPU、内存卸载,普通用户很难把它变成日常工具。
27B模型正好卡在中间。模型规模已经足够支撑复杂任务,经过4-bit量化后,又能放进24GB显存的消费级显卡。Qwen3.8-27B就是这一档位中适合拿来做本地测试的模型:它覆盖编程、研究型任务、长周期智能体工作流,并支持原生多模态、思考模式和长上下文。
问题也随之变得具体起来:
- RTX 3090能不能流畅运行?
- RTX 4090除了“能跑”,速度是否有明显优势?
- RTX 5090的高带宽和新架构,究竟能快多少?
- 测试出来的150 Token/s甚至接近200 Token/s,日常使用能不能达到?
目前能够确认的测试数据,主要来自两类场景。一类是统一条件下对RTX 3090和RTX 5090进行对比,使用同一个约17GB的Q4量化模型、相同的推理框架和多组提示词;另一类是RTX 4090的单卡部署案例,重点在于模型能否完整放入显存并用于本地工作流。
因此,下面的速度数据可以用来判断量级,但不能把所有结果拼成一张严格的三卡排行榜。显卡型号之外,量化格式、推理框架、MTP设置、上下文长度、提示词类型,以及测试时后台占用的显存,都会改变最终结果。
先过显存这一关:Q4量化是关键
Qwen3.8-27B的全参数版本并不适合直接塞进普通单卡。真正让它进入个人电脑的,是GGUF等量化格式。
测试的主流方案,是约16GB至17GB的Q4或动态4-bit版本。模型文件大小和实际显存占用并不完全相同,推理时还要为运行状态、KV Cache和上下文预留空间,但24GB显存通常足以让这类模型完整加载到GPU中。
这点非常重要。
如果模型的一部分被迫放进系统内存,生成过程就会频繁经过PCIe在显卡和内存之间搬运数据。模型仍然可以运行,但Token/s通常会明显下降,响应也更容易出现抖动。对于需要连续输出代码、反复修改文件的工作流,几秒钟一次的等待和十几秒一次的等待,使用感受差别很大。
三张显卡的基础条件可以先这样看:
| 显卡 | 显存 | Q4/动态4-bit部署 | 适合的本地定位 |
|---|---|---|---|
| RTX 3090 | 24GB | 可以单卡完整加载 | 低成本进入27B本地推理 |
| RTX 4090 | 24GB | 可以单卡完整加载 | 成熟的24GB全GPU部署平台 |
| RTX 5090 | 32GB | 可以轻松加载,并有更多余量 | 高吞吐、长时间和重度工作流 |
RTX 3090和RTX 4090都拥有24GB显存。按照这些部署案例中的Q4条件,两者都能在单卡内运行Qwen3.8-27B。RTX 5090的显存余量更大,除了运行Q4版本,也更适合尝试更高精度的量化格式。
如果机器拥有32GB显存,可以考虑Q6甚至Q8。更高的量化精度通常意味着更大的显存占用和更低的速度,但在代码生成、专业知识问答和复杂推理中,输出质量可能更接近未量化版本。具体是否值得,需要看任务对准确率的要求。
对大多数24GB显卡用户,Q4_K_M或同等级别的动态4-bit版本仍然是更现实的起点。它在模型质量、显存压力和速度之间比较平衡。没有必要为了追求一个更高的量化档位,把整个模型拆到CPU和GPU之间,最后得到更慢的体验。
262K上下文不等于单卡可以随意使用
Qwen3.8-27B标称支持原生262K Token上下文,并可以通过YaRN等方式扩展到更长的上下文范围。这个参数说明模型具备处理长输入的能力,但不能直接理解为:24GB显卡可以在任何情况下稳定运行几十万Token。
上下文越长,KV Cache占用越高。显存除了装模型权重,还要保存已经读过的内容,以便模型继续生成。假设模型权重已经占用约17GB,24GB显存只剩下约7GB空间,那么上下文长度、批处理大小和生成长度都需要受到限制。
实际部署时,至少要关注以下设置:
- 模型权重是否全部加载到GPU。
- KV Cache使用的精度和大小。
- 上下文长度是否真的需要开到极限。
- 是否还有浏览器、图形软件或其他模型占用显存。
- 推理框架是否支持目标模型的长上下文和相关优化。
把上下文窗口开到理论上限,和能否稳定完成一轮本地任务,是两件事。
3090和5090的统一测试:基础速度差距明显
在一组对比测试中,使用同一个约17GB的Q4量化文件、lama.cpp推理框架,以及单张RTX 3090和单张RTX 5090。测试准备了9组真实提示词,每组运行3次,用于减少单次结果偶然性。
没有开启MTP时,两张卡的平均解码速度如下:
| 显卡 | 基础解码速度 | 相对RTX 3090 |
|---|---|---|
| RTX 3090 | 约41 Token/s | 1.00倍 |
| RTX 5090 | 约74 Token/s | 约1.82倍 |
这里的Token/s指模型生成Token的速度。它和首字延迟不是同一个指标。模型可能需要先花一段时间读取提示词、构建上下文,随后才进入稳定输出阶段。因此,74 Token/s并不表示用户按下发送按钮后,首个字在不到一秒内出现。
但进入连续生成后,差距会很直观。
RTX 3090以约41 Token/s输出中文或代码时,已经足够进行普通聊天、短代码修改和资料整理。RTX 5090约74 Token/s,则更适合长篇代码生成、持续输出分析过程,以及需要连续生成大量内容的任务。
如果只看基础解码,5090大约是3090的1.82倍。这个差距主要来自硬件吞吐能力,尤其是显存带宽。相关测试中,RTX 5090的显存带宽约为RTX 3090的1.9倍。在模型完整放入显存后,GPU需要不断读取模型权重并参与计算,显存带宽就会直接影响每个Token的生成效率。
不过,真正让两张卡拉开更大差距的,是MTP。
开启MTP后,3090也能达到可用速度
MTP,即多Token预测,可以理解为让模型提前猜测后续几个Token。
传统生成方式通常是:
- 模型生成一个Token。
- 读取新的序列状态。
- 再生成下一个Token。
- 重复执行。
MTP会让模型先提出一小段候选Token,再由主模型一次性验证这些候选结果。如果候选内容被接受,就可以在一次前向计算中确认多个Token,减少逐个生成的次数。
在这组测试中,DraftMTP设置为8。开启后,结果变成:
| 显卡 | 未开启MTP | 开启MTP | 速度增幅 |
|---|---|---|---|
| RTX 3090 | 约41 Token/s | 约55 Token/s | 约35% |
| RTX 5090 | 约74 Token/s | 约133 Token/s | 约80% |
RTX 3090从41 Token/s提升到约55 Token/s,增幅约35%。这个结果对已经拥有3090的人很有意义。它意味着这张几年前的24GB显卡,不需要更换硬件,也能把27B模型的交互速度提升到比较稳定的水平。
RTX 5090则从约74 Token/s提升到约133 Token/s,测试中的代码类任务峰值接近167 Token/s。按照统一测试的平均值计算,开启MTP后,5090大约是3090的2.06倍。
另一组独立的5090测试中,Q4模型速度达到150 Token/s以上,标题数据为157 Token/s;3090则约为53 Token/s。这组结果可以作为另一个环境下的验证案例,但不能和前面的41、55、74、133 Token/s直接混合计算。不同测试可能使用了不同的驱动、框架版本、上下文、提示词和系统负载。
较稳妥的表达是:
在统一测试中,RTX 3090开启MTP后约55 Token/s,RTX 5090约133 Token/s;在其他Q4部署环境中,两张卡也分别出现约53 Token/s和157 Token/s的结果。
这样既保留了实测范围,也不会把某个环境中的峰值包装成所有用户都能复制的速度。
MTP为什么不是固定的“加速按钮”
MTP的收益取决于模型提前猜测的内容能被主模型接受多少。
如果提示词要求模型输出固定格式的JSON、重复性较高的代码结构,或者继续完成已经明确的句子,候选Token更容易被接受。一次验证可能确认多个Token,速度自然提升。
开放式写作、创意讨论和需要频繁转向的复杂推理则不同。模型很难准确预测接下来会选择哪些词,候选Token的接受率可能下降。此时MTP仍然可能有帮助,但加速幅度不会保持在某个固定比例。
可以用一个简单的例子理解:
- 让模型补全一段已经写了一半的Python函数,后续结构比较明确,MTP更容易发挥作用。
- 让模型根据一句模糊的要求设计产品方案,可能先分析需求,再切换角度,候选内容变化很快,MTP收益就会波动。
- 让模型生成严格的HTML、SVG或JSON,格式约束较强,接受率通常更容易保持。
- 让模型进行长篇开放式故事创作,Token选择更分散,峰值速度未必稳定。
因此,MTP参数需要在自己的任务上测试。DraftMTP=8是一个测试中的设置,不应被理解成所有机器都必须使用的固定值。推理框架、量化格式、模型文件和显存余量都会影响结果。
如果开启MTP后速度没有提升,甚至出现波动,常见原因包括:
- 当前框架对该模型的MTP支持不完整。
- Draft模型或相关资源没有正确加载。
- 草稿Token的接受率低。
- 上下文过长,KV Cache挤压了可用显存。
- 后台应用占用显存,导致部分计算或数据交换变慢。
- 测试时混用了不同的量化格式。
所以,MTP不能脱离部署环境单独谈。它是一项依赖推理框架和任务内容的优化。
RTX 4090的位置:最成熟的24GB部署档
RTX 4090没有和3090、5090一起测试,因此完全相同的平均测速数据。
4090的重点不是标准化跑分,而是展示一套可工作的本地方案:24GB显存,动态4-bit量化版本,模型完整放入GPU,通过Open WebUI进行纯本地推理,不需要按Prompt调用云端API,也不产生对应的接口费用。
从部署门槛看,4090和3090处于同一档。它们都能承载约16GB至17GB的Q4模型,并为上下文和运行状态留下余量。4090的优势在于更高的计算性能和更快的显存子系统,但它究竟能否稳定达到某个具体Token/s,仍应以同一套模型、框架和提示词进行实测。
对于4090,更可靠的结论是:
- 它可以完整运行Qwen3.8-27B的4-bit版本。
- 它适合搭建长期使用的个人本地AI环境。
- 它能够支持代码生成、网页生成、视觉理解和多轮对话。
- 它的标准平均吞吐需要在统一测试条件下确认。
即使同时打开多个应用和大量浏览器标签,4090仍能维持可接受的生成表现。这说明它适合做个人工作站,而不是只能在关闭所有后台程序后运行一次演示。
本地工作流也比单纯聊天更能体现27B模型的价值。测试案例包括生成带交互动画的网站、小游戏、类似桌面的界面,以及SVG场景。模型能够产出可运行的初版,这对前端原型和快速验证很方便。
但“能生成”不等于“交付完成”。案例中也出现过页面空白、组件功能不完整、元素位置错误等问题。网页代码看起来很长,并不代表浏览器里所有交互都已经接通。运行本地模型时,最好把它当成一个速度很快的协作开发工具:让模型先产出结构,再通过浏览器检查、控制台报错和逐步修改完成工作。
这也是4090的现实价值。它展示的是27B模型可以进入个人电脑的日常工作流。
三张卡的使用差别,最终体现在等待方式上
如果只看“能不能运行”,3090、4090和5090都可以处理Q4版本。真正的差别,是用户愿意怎样等待。
RTX 3090在基础模式下约41 Token/s,开启MTP后约55 Token/s。普通问答、代码解释、短文本生成都可以使用。长回答生成时,用户仍然能看到内容持续出现,不会像CPU卸载那样长时间停滞。
RTX 4090的优势主要是成熟、均衡和部署经验丰富。它是24GB显存本地模型环境中比较稳妥的选择,尤其适合已经拥有这张卡、希望直接开始使用的人,速度略高于3090。
RTX 5090的优势则更集中在高吞吐场景。开启MTP后约133 Token/s,特定代码任务接近167 Token/s,意味着长输出可以更快完成。对于需要不断生成、执行、检查、修改的Agent工作流,速度提升会积累成明显的时间差。
举个简单的任务链:
- 模型读取项目结构。
- 生成一组修改方案。
- 输出多个文件的代码。
- 根据运行结果修复错误。
- 再次生成测试和说明。
如果每轮输出都较长,3090和5090之间的差距会在多轮循环中不断放大。一次回答只快几秒,连续十轮以后,可能就是数分钟的差别。
但如果主要任务是短问答、翻译和摘要,模型只输出几十到几百个Token,5090的峰值速度未必能转化为同等比例的实际节省。此时首字延迟、提示词处理速度和界面响应,可能比持续解码速度更重要。
可以用下面的方式选择:
| 使用场景 | 更合适的选择 |
|---|---|
| 已有RTX 3090,想本地运行27B | 保留3090,使用Q4并测试MTP |
| 想要稳定的24GB全GPU部署 | RTX 4090 |
| 大量代码生成、长文本和Agent循环 | RTX 5090 |
| 需要更高量化精度和更长上下文余量 | RTX 5090 |
| 主要是短问答和偶尔使用 | 3090或4090已经足够 |
这个表格不能代替实测,但能帮助用户先排除不合适的购买理由。为了偶尔问几句问题,没有必要只追逐最高Token/s;如果每天都在本地运行长代码任务,高吞吐显卡才更容易体现价值。
不要被一个峰值数字带偏
本地模型测试最容易被误读的地方,就是把峰值当成平均体验。
“157 Token/s”或“接近200 Token/s”确实说明硬件和推理优化具备很高的上限,但这个数字可能来自较短、结构明确的提示词,也可能是在MTP接受率较高的代码场景中出现。它不能直接推导出:
- 所有问题都能达到这个速度。
- 中文长文本和创意写作也保持同样速度。
- 长上下文下速度不会下降。
- 换一个量化文件仍然能得到相同结果。
- 4090一定处于3090和5090的某个精确位置。
想做有意义的横评,至少应该固定以下条件:
| 测试变量 | 需要统一的内容 |
|---|---|
| 模型 | 同一版本、同一量化格式、同一模型文件 |
| 推理框架 | 相同版本和相同编译选项 |
| 硬件 | 单卡运行,关闭或记录后台显存占用 |
| 上下文 | 相同提示词长度和相同上下文窗口 |
| 任务 | 同一批代码、问答、结构化输出和长文本提示 |
| 优化项 | MTP、Flash Attention、批处理等设置一致 |
| 统计方式 | 预热后多次运行,记录平均值和峰值 |
还要区分Prompt处理速度和生成速度。很多工具会把提示词读取阶段和输出阶段分开显示。对于长文档问答,用户可能先等待较长的输入处理时间,随后才看到很快的连续输出。如果只看后面的Decode速度,会高估整体响应体验。
后台程序也不能忽略。浏览器标签页、视频剪辑软件、游戏、图形渲染程序,都可能占用显存。5090拥有更大的余量,受影响的程度可能较小;24GB显卡则更容易在长上下文任务中碰到显存边界。
一套更实际的部署思路
对于24GB显存显卡,可以从较保守的配置开始:
- 选择Q4或动态4-bit量化版本。
- 确认模型权重全部加载到GPU。
- 设置一个实际需要的上下文长度,不要一开始就追求理论上限。
- 使用支持该模型特性的新版lama.cpp或其他兼容框架。
- 在短代码、结构化输出和开放式问答上分别测试MTP。
- 记录平均Token/s、首字延迟和显存占用。
- 再决定是否提高量化精度或扩大上下文。
测试时不要只问“你好”或让模型输出一小段文字。更有参考价值的测试任务包括:
- 生成并修改一段中等长度的Python或TypeScript代码。
- 根据一份长文档回答多个问题。
- 输出严格格式的JSON。
- 生成包含HTML、CSS和JavaScript的简单页面。
- 连续进行几轮错误修复。
- 在保留较长上下文的情况下继续对话。
这样测出来的速度,才接近日常使用。
如果3090开启MTP后能够稳定达到约50 Token/s,已经足以覆盖大多数个人本地任务。不要因为它跑不出5090的数字,就认为它“不适合”。3090的主要限制是速度和显存余量,而不是完全无法使用。
4090则是一个成熟的中间选择。它不一定需要成为三卡中某个精确的“第二名”,因为它的实际价值在于24GB显存、较强性能和大量本地部署案例带来的确定性。对已有4090的人来说,Qwen3.8-27B已经具备直接尝试的条件。
5090适合把本地模型当成高频生产工具的人。每天长时间编程、反复调用Agent、生成较大规模项目代码,或者希望减少输出等待,5090的高带宽和MTP收益会更容易被感知。它带来的不是“模型突然会了更多”,而是模型更快把已经会的内容输出出来,工作流可以承载更多轮交互。
该怎样理解这次对比
Qwen3.8-27B的本地部署门槛,可以先用一句话概括:
24GB显存显卡配合Q4量化,可以运行;MTP决定交互是否更顺;更高的显存带宽决定长时间生成时能快多少。
统一测试给出的数字比较清楚:
- RTX 3090:基础约41 Token/s,开启MTP后约55 Token/s。
- RTX 5090:基础约74 Token/s,开启MTP后约133 Token/s。
- RTX 5090在部分代码场景中接近167 Token/s。
- 其他Q4环境中,5090出现过约157 Token/s,3090出现过约53 Token/s。
- RTX 4090:明确可以在24GB显存内运行动态4-bit版本,但缺少与前两张卡同协议的平均测速数据。
对3090用户,最经济的做法通常是先把量化格式、推理框架和MTP配置调好。对4090用户,重点是建立稳定的本地工作流,观察长上下文和多应用并行时的显存余量。对5090用户,重点则是让高吞吐真正服务于长代码、连续修改和Agent循环,而不是只在短提示词上追逐一个漂亮峰值。
27B模型能在单张24GB显卡上完成多模态理解、代码生成和长文档任务,这件事比某一次测试中出现的最高速度更值得关注。显卡性能的差异,决定的是等待时间、任务密度和连续工作时的舒适程度;模型能不能成为可用工具,还要看量化质量、上下文设置以及整个本地工作流是否搭得合理。