Qwen3.8-27B本地实测:3090、4090与5090怎么选

Qwen3.8-27B的本地部署,关键不只是显卡能否装下模型,还要看量化格式、MTP加速和实际任务类型。本文对比RTX 3090、4090与5090的显存门槛、生成速度和使用体验。

Qwen3.8-27B本地部署:3090、4090与5090怎么选

对于想在本地运行大模型的人来说,27B是一个很有意思的档位。

7B、8B模型容易部署,响应也快,但面对复杂代码、长文档分析和多步骤任务时,能力往往不够稳定。70B级别模型能力更强,却通常需要多张显卡,或者接受明显的CPU、内存卸载,普通用户很难把它变成日常工具。

27B模型正好卡在中间。模型规模已经足够支撑复杂任务,经过4-bit量化后,又能放进24GB显存的消费级显卡。Qwen3.8-27B就是这一档位中适合拿来做本地测试的模型:它覆盖编程、研究型任务、长周期智能体工作流,并支持原生多模态、思考模式和长上下文。

问题也随之变得具体起来:

  • RTX 3090能不能流畅运行?
  • RTX 4090除了“能跑”,速度是否有明显优势?
  • RTX 5090的高带宽和新架构,究竟能快多少?
  • 测试出来的150 Token/s甚至接近200 Token/s,日常使用能不能达到?

目前能够确认的测试数据,主要来自两类场景。一类是统一条件下对RTX 3090和RTX 5090进行对比,使用同一个约17GB的Q4量化模型、相同的推理框架和多组提示词;另一类是RTX 4090的单卡部署案例,重点在于模型能否完整放入显存并用于本地工作流。

因此,下面的速度数据可以用来判断量级,但不能把所有结果拼成一张严格的三卡排行榜。显卡型号之外,量化格式、推理框架、MTP设置、上下文长度、提示词类型,以及测试时后台占用的显存,都会改变最终结果。

先过显存这一关:Q4量化是关键

Qwen3.8-27B的全参数版本并不适合直接塞进普通单卡。真正让它进入个人电脑的,是GGUF等量化格式。

测试的主流方案,是约16GB至17GB的Q4或动态4-bit版本。模型文件大小和实际显存占用并不完全相同,推理时还要为运行状态、KV Cache和上下文预留空间,但24GB显存通常足以让这类模型完整加载到GPU中。

这点非常重要。

如果模型的一部分被迫放进系统内存,生成过程就会频繁经过PCIe在显卡和内存之间搬运数据。模型仍然可以运行,但Token/s通常会明显下降,响应也更容易出现抖动。对于需要连续输出代码、反复修改文件的工作流,几秒钟一次的等待和十几秒一次的等待,使用感受差别很大。

三张显卡的基础条件可以先这样看:

显卡 显存 Q4/动态4-bit部署 适合的本地定位
RTX 3090 24GB 可以单卡完整加载 低成本进入27B本地推理
RTX 4090 24GB 可以单卡完整加载 成熟的24GB全GPU部署平台
RTX 5090 32GB 可以轻松加载,并有更多余量 高吞吐、长时间和重度工作流

RTX 3090和RTX 4090都拥有24GB显存。按照这些部署案例中的Q4条件,两者都能在单卡内运行Qwen3.8-27B。RTX 5090的显存余量更大,除了运行Q4版本,也更适合尝试更高精度的量化格式。

如果机器拥有32GB显存,可以考虑Q6甚至Q8。更高的量化精度通常意味着更大的显存占用和更低的速度,但在代码生成、专业知识问答和复杂推理中,输出质量可能更接近未量化版本。具体是否值得,需要看任务对准确率的要求。

对大多数24GB显卡用户,Q4_K_M或同等级别的动态4-bit版本仍然是更现实的起点。它在模型质量、显存压力和速度之间比较平衡。没有必要为了追求一个更高的量化档位,把整个模型拆到CPU和GPU之间,最后得到更慢的体验。

262K上下文不等于单卡可以随意使用

Qwen3.8-27B标称支持原生262K Token上下文,并可以通过YaRN等方式扩展到更长的上下文范围。这个参数说明模型具备处理长输入的能力,但不能直接理解为:24GB显卡可以在任何情况下稳定运行几十万Token。

上下文越长,KV Cache占用越高。显存除了装模型权重,还要保存已经读过的内容,以便模型继续生成。假设模型权重已经占用约17GB,24GB显存只剩下约7GB空间,那么上下文长度、批处理大小和生成长度都需要受到限制。

实际部署时,至少要关注以下设置:

  1. 模型权重是否全部加载到GPU。
  2. KV Cache使用的精度和大小。
  3. 上下文长度是否真的需要开到极限。
  4. 是否还有浏览器、图形软件或其他模型占用显存。
  5. 推理框架是否支持目标模型的长上下文和相关优化。

把上下文窗口开到理论上限,和能否稳定完成一轮本地任务,是两件事。

3090和5090的统一测试:基础速度差距明显

在一组对比测试中,使用同一个约17GB的Q4量化文件、lama.cpp推理框架,以及单张RTX 3090和单张RTX 5090。测试准备了9组真实提示词,每组运行3次,用于减少单次结果偶然性。

没有开启MTP时,两张卡的平均解码速度如下:

显卡 基础解码速度 相对RTX 3090
RTX 3090 约41 Token/s 1.00倍
RTX 5090 约74 Token/s 约1.82倍

这里的Token/s指模型生成Token的速度。它和首字延迟不是同一个指标。模型可能需要先花一段时间读取提示词、构建上下文,随后才进入稳定输出阶段。因此,74 Token/s并不表示用户按下发送按钮后,首个字在不到一秒内出现。

但进入连续生成后,差距会很直观。

RTX 3090以约41 Token/s输出中文或代码时,已经足够进行普通聊天、短代码修改和资料整理。RTX 5090约74 Token/s,则更适合长篇代码生成、持续输出分析过程,以及需要连续生成大量内容的任务。

如果只看基础解码,5090大约是3090的1.82倍。这个差距主要来自硬件吞吐能力,尤其是显存带宽。相关测试中,RTX 5090的显存带宽约为RTX 3090的1.9倍。在模型完整放入显存后,GPU需要不断读取模型权重并参与计算,显存带宽就会直接影响每个Token的生成效率。

不过,真正让两张卡拉开更大差距的,是MTP。

开启MTP后,3090也能达到可用速度

MTP,即多Token预测,可以理解为让模型提前猜测后续几个Token。

传统生成方式通常是:

  1. 模型生成一个Token。
  2. 读取新的序列状态。
  3. 再生成下一个Token。
  4. 重复执行。

MTP会让模型先提出一小段候选Token,再由主模型一次性验证这些候选结果。如果候选内容被接受,就可以在一次前向计算中确认多个Token,减少逐个生成的次数。

在这组测试中,DraftMTP设置为8。开启后,结果变成:

显卡 未开启MTP 开启MTP 速度增幅
RTX 3090 约41 Token/s 约55 Token/s 约35%
RTX 5090 约74 Token/s 约133 Token/s 约80%

RTX 3090从41 Token/s提升到约55 Token/s,增幅约35%。这个结果对已经拥有3090的人很有意义。它意味着这张几年前的24GB显卡,不需要更换硬件,也能把27B模型的交互速度提升到比较稳定的水平。

RTX 5090则从约74 Token/s提升到约133 Token/s,测试中的代码类任务峰值接近167 Token/s。按照统一测试的平均值计算,开启MTP后,5090大约是3090的2.06倍。

另一组独立的5090测试中,Q4模型速度达到150 Token/s以上,标题数据为157 Token/s;3090则约为53 Token/s。这组结果可以作为另一个环境下的验证案例,但不能和前面的41、55、74、133 Token/s直接混合计算。不同测试可能使用了不同的驱动、框架版本、上下文、提示词和系统负载。

较稳妥的表达是:

在统一测试中,RTX 3090开启MTP后约55 Token/s,RTX 5090约133 Token/s;在其他Q4部署环境中,两张卡也分别出现约53 Token/s和157 Token/s的结果。

这样既保留了实测范围,也不会把某个环境中的峰值包装成所有用户都能复制的速度。

MTP为什么不是固定的“加速按钮”

MTP的收益取决于模型提前猜测的内容能被主模型接受多少。

如果提示词要求模型输出固定格式的JSON、重复性较高的代码结构,或者继续完成已经明确的句子,候选Token更容易被接受。一次验证可能确认多个Token,速度自然提升。

开放式写作、创意讨论和需要频繁转向的复杂推理则不同。模型很难准确预测接下来会选择哪些词,候选Token的接受率可能下降。此时MTP仍然可能有帮助,但加速幅度不会保持在某个固定比例。

可以用一个简单的例子理解:

  • 让模型补全一段已经写了一半的Python函数,后续结构比较明确,MTP更容易发挥作用。
  • 让模型根据一句模糊的要求设计产品方案,可能先分析需求,再切换角度,候选内容变化很快,MTP收益就会波动。
  • 让模型生成严格的HTML、SVG或JSON,格式约束较强,接受率通常更容易保持。
  • 让模型进行长篇开放式故事创作,Token选择更分散,峰值速度未必稳定。

因此,MTP参数需要在自己的任务上测试。DraftMTP=8是一个测试中的设置,不应被理解成所有机器都必须使用的固定值。推理框架、量化格式、模型文件和显存余量都会影响结果。

如果开启MTP后速度没有提升,甚至出现波动,常见原因包括:

  • 当前框架对该模型的MTP支持不完整。
  • Draft模型或相关资源没有正确加载。
  • 草稿Token的接受率低。
  • 上下文过长,KV Cache挤压了可用显存。
  • 后台应用占用显存,导致部分计算或数据交换变慢。
  • 测试时混用了不同的量化格式。

所以,MTP不能脱离部署环境单独谈。它是一项依赖推理框架和任务内容的优化。

RTX 4090的位置:最成熟的24GB部署档

RTX 4090没有和3090、5090一起测试,因此完全相同的平均测速数据。

4090的重点不是标准化跑分,而是展示一套可工作的本地方案:24GB显存,动态4-bit量化版本,模型完整放入GPU,通过Open WebUI进行纯本地推理,不需要按Prompt调用云端API,也不产生对应的接口费用。

从部署门槛看,4090和3090处于同一档。它们都能承载约16GB至17GB的Q4模型,并为上下文和运行状态留下余量。4090的优势在于更高的计算性能和更快的显存子系统,但它究竟能否稳定达到某个具体Token/s,仍应以同一套模型、框架和提示词进行实测。

对于4090,更可靠的结论是:

  • 它可以完整运行Qwen3.8-27B的4-bit版本。
  • 它适合搭建长期使用的个人本地AI环境。
  • 它能够支持代码生成、网页生成、视觉理解和多轮对话。
  • 它的标准平均吞吐需要在统一测试条件下确认。

即使同时打开多个应用和大量浏览器标签,4090仍能维持可接受的生成表现。这说明它适合做个人工作站,而不是只能在关闭所有后台程序后运行一次演示。

本地工作流也比单纯聊天更能体现27B模型的价值。测试案例包括生成带交互动画的网站、小游戏、类似桌面的界面,以及SVG场景。模型能够产出可运行的初版,这对前端原型和快速验证很方便。

但“能生成”不等于“交付完成”。案例中也出现过页面空白、组件功能不完整、元素位置错误等问题。网页代码看起来很长,并不代表浏览器里所有交互都已经接通。运行本地模型时,最好把它当成一个速度很快的协作开发工具:让模型先产出结构,再通过浏览器检查、控制台报错和逐步修改完成工作。

这也是4090的现实价值。它展示的是27B模型可以进入个人电脑的日常工作流。

三张卡的使用差别,最终体现在等待方式上

如果只看“能不能运行”,3090、4090和5090都可以处理Q4版本。真正的差别,是用户愿意怎样等待。

RTX 3090在基础模式下约41 Token/s,开启MTP后约55 Token/s。普通问答、代码解释、短文本生成都可以使用。长回答生成时,用户仍然能看到内容持续出现,不会像CPU卸载那样长时间停滞。

RTX 4090的优势主要是成熟、均衡和部署经验丰富。它是24GB显存本地模型环境中比较稳妥的选择,尤其适合已经拥有这张卡、希望直接开始使用的人,速度略高于3090。

RTX 5090的优势则更集中在高吞吐场景。开启MTP后约133 Token/s,特定代码任务接近167 Token/s,意味着长输出可以更快完成。对于需要不断生成、执行、检查、修改的Agent工作流,速度提升会积累成明显的时间差。

举个简单的任务链:

  1. 模型读取项目结构。
  2. 生成一组修改方案。
  3. 输出多个文件的代码。
  4. 根据运行结果修复错误。
  5. 再次生成测试和说明。

如果每轮输出都较长,3090和5090之间的差距会在多轮循环中不断放大。一次回答只快几秒,连续十轮以后,可能就是数分钟的差别。

但如果主要任务是短问答、翻译和摘要,模型只输出几十到几百个Token,5090的峰值速度未必能转化为同等比例的实际节省。此时首字延迟、提示词处理速度和界面响应,可能比持续解码速度更重要。

可以用下面的方式选择:

使用场景 更合适的选择
已有RTX 3090,想本地运行27B 保留3090,使用Q4并测试MTP
想要稳定的24GB全GPU部署 RTX 4090
大量代码生成、长文本和Agent循环 RTX 5090
需要更高量化精度和更长上下文余量 RTX 5090
主要是短问答和偶尔使用 3090或4090已经足够

这个表格不能代替实测,但能帮助用户先排除不合适的购买理由。为了偶尔问几句问题,没有必要只追逐最高Token/s;如果每天都在本地运行长代码任务,高吞吐显卡才更容易体现价值。

不要被一个峰值数字带偏

本地模型测试最容易被误读的地方,就是把峰值当成平均体验。

“157 Token/s”或“接近200 Token/s”确实说明硬件和推理优化具备很高的上限,但这个数字可能来自较短、结构明确的提示词,也可能是在MTP接受率较高的代码场景中出现。它不能直接推导出:

  • 所有问题都能达到这个速度。
  • 中文长文本和创意写作也保持同样速度。
  • 长上下文下速度不会下降。
  • 换一个量化文件仍然能得到相同结果。
  • 4090一定处于3090和5090的某个精确位置。

想做有意义的横评,至少应该固定以下条件:

测试变量 需要统一的内容
模型 同一版本、同一量化格式、同一模型文件
推理框架 相同版本和相同编译选项
硬件 单卡运行,关闭或记录后台显存占用
上下文 相同提示词长度和相同上下文窗口
任务 同一批代码、问答、结构化输出和长文本提示
优化项 MTP、Flash Attention、批处理等设置一致
统计方式 预热后多次运行,记录平均值和峰值

还要区分Prompt处理速度和生成速度。很多工具会把提示词读取阶段和输出阶段分开显示。对于长文档问答,用户可能先等待较长的输入处理时间,随后才看到很快的连续输出。如果只看后面的Decode速度,会高估整体响应体验。

后台程序也不能忽略。浏览器标签页、视频剪辑软件、游戏、图形渲染程序,都可能占用显存。5090拥有更大的余量,受影响的程度可能较小;24GB显卡则更容易在长上下文任务中碰到显存边界。

一套更实际的部署思路

对于24GB显存显卡,可以从较保守的配置开始:

  1. 选择Q4或动态4-bit量化版本。
  2. 确认模型权重全部加载到GPU。
  3. 设置一个实际需要的上下文长度,不要一开始就追求理论上限。
  4. 使用支持该模型特性的新版lama.cpp或其他兼容框架。
  5. 在短代码、结构化输出和开放式问答上分别测试MTP。
  6. 记录平均Token/s、首字延迟和显存占用。
  7. 再决定是否提高量化精度或扩大上下文。

测试时不要只问“你好”或让模型输出一小段文字。更有参考价值的测试任务包括:

  • 生成并修改一段中等长度的Python或TypeScript代码。
  • 根据一份长文档回答多个问题。
  • 输出严格格式的JSON。
  • 生成包含HTML、CSS和JavaScript的简单页面。
  • 连续进行几轮错误修复。
  • 在保留较长上下文的情况下继续对话。

这样测出来的速度,才接近日常使用。

如果3090开启MTP后能够稳定达到约50 Token/s,已经足以覆盖大多数个人本地任务。不要因为它跑不出5090的数字,就认为它“不适合”。3090的主要限制是速度和显存余量,而不是完全无法使用。

4090则是一个成熟的中间选择。它不一定需要成为三卡中某个精确的“第二名”,因为它的实际价值在于24GB显存、较强性能和大量本地部署案例带来的确定性。对已有4090的人来说,Qwen3.8-27B已经具备直接尝试的条件。

5090适合把本地模型当成高频生产工具的人。每天长时间编程、反复调用Agent、生成较大规模项目代码,或者希望减少输出等待,5090的高带宽和MTP收益会更容易被感知。它带来的不是“模型突然会了更多”,而是模型更快把已经会的内容输出出来,工作流可以承载更多轮交互。

该怎样理解这次对比

Qwen3.8-27B的本地部署门槛,可以先用一句话概括:

24GB显存显卡配合Q4量化,可以运行;MTP决定交互是否更顺;更高的显存带宽决定长时间生成时能快多少。

统一测试给出的数字比较清楚:

  • RTX 3090:基础约41 Token/s,开启MTP后约55 Token/s。
  • RTX 5090:基础约74 Token/s,开启MTP后约133 Token/s。
  • RTX 5090在部分代码场景中接近167 Token/s。
  • 其他Q4环境中,5090出现过约157 Token/s,3090出现过约53 Token/s。
  • RTX 4090:明确可以在24GB显存内运行动态4-bit版本,但缺少与前两张卡同协议的平均测速数据。

对3090用户,最经济的做法通常是先把量化格式、推理框架和MTP配置调好。对4090用户,重点是建立稳定的本地工作流,观察长上下文和多应用并行时的显存余量。对5090用户,重点则是让高吞吐真正服务于长代码、连续修改和Agent循环,而不是只在短提示词上追逐一个漂亮峰值。

27B模型能在单张24GB显卡上完成多模态理解、代码生成和长文档任务,这件事比某一次测试中出现的最高速度更值得关注。显卡性能的差异,决定的是等待时间、任务密度和连续工作时的舒适程度;模型能不能成为可用工具,还要看量化质量、上下文设置以及整个本地工作流是否搭得合理。