Qwen3.8-27B on a single RTX 5090 部署记录
在单张 RTX 5090(32 GB)上用 llama.cpp + DFlash2 块扩散 drafter 部署 Qwen3.8-27B:基准吞吐 218~233 tok/s、262K/393K 上下文可用;但实战复杂代码任务 drafter 命中率从 0.60 掉到 0.35,综合经济效率不如 4090-48G 方案。
在单张 RTX 5090(32 GB)上用 llama.cpp + DFlash2 块扩散 drafter 部署 Qwen3.8-27B:基准吞吐 218~233 tok/s、262K/393K 上下文可用;但实战复杂代码任务 drafter 命中率从 0.60 掉到 0.35,综合经济效率不如 4090-48G 方案。
Qwen3.8-27B 默认 xhigh 推理强度导致“雷霆思考”——模型在简单任务上陷入自我推翻的循环,消耗数万 token。本文通过 tau-bench 量化复现,分析根因,并给出 opencode 配置注入 logit_bias 的 token 级修复方案。
从 4 个原语(Intent / Check / Work / World State)出发,经 13 个定义与 2 条公理,推出 6 条定理,构建一个分形自相似的 Agent Harness 架构规范。
在 48 GB RTX 4090 上用 vLLM 0.28 + MTP 投机解码自部署 Qwen3.8-27B-AWQ-MTP:单流 66~69 tok/s、4 并发 ~158 tok/s,262K 全上下文稳定 2 路并行。
用集合论把体裁/主题/标签三维筛选形式化为一条交并表达式,导出单调性与 Galois 对应,给出自适应选项的可用性判定与复杂度。
服务端 Markdown 扩展为公式分配编号、把 \label 变成锚点、把 \eqref/\ref 解析成可点击引用,KaTeX 只负责排版;三步流程、实现细节与边界。
$2^{V_d}$ 是「$V_d$ 的幂集」(power set),也就是 $V_d$ 的所有子集构成的集合。那么,怎么向奶奶解释什么是幂集呢?
没有符合当前筛选的文章。