大家好!我是瓜哥。前互联网技术副总裁,现在带队死磕 AI 编程。
在前面两篇文章里,我分享了在 48 小时黑客松上,做用药助理 「med-agent」 的产品设计与极简后端架构。
在本地且数据不出域的现场,很多朋友看后非常好奇。
- 到底是用什么硬件跑模型的?
- 哪几套语音和视觉模型?
- 是怎么在本地跑起来的?
说实话,我们一口气把 4 个 AI 模型 ,全部压进了一台有 128G 统一内存的硬件里!
今天就来详细盘盘,这 4 个模型的硬核参数、任务映射,以及我们在现场跑出来的真实压测数据。
01 | 基础环境配置
① 设备与部署平台
- 硬件算力:某 AI TOP 硬件平台
- 模型部署:开源 imma 模型部署平台
- 开源模型:支持主流开源模型
② 端侧 4 款开源大模型
- Qwen3.6-35B-A3B:推理模型。
Agent大脑,负责推理和复杂任务处理。
- Qwen3-ASR-1.7B:语音识别模型。ASR自动语音识别,负责用户输入语音识别和转换。
- Qwen3-TTS-0.6B:语音合成模型。TTS文本到语音合成,负责结果语音播报。
- CosyVoice:语音合成模型。TTS文本到语音合成,负责结果语音播报。
③ med-agent 项目延展资料
- 产品设计与交互。48小时黑客松:我们是如何给老年人设计 “零门槛” 用药助理的?
02 | 底层基建:桌面硬件、部署平台
① 硬件平台
为避免广告嫌疑,就不说品牌和型号了。
说下硬件的配置,128 G的统一内存,搭载 N 开头的显卡,售价大概 3 个 W。
② 模型部署平台
在 48 小时极速开发中,繁琐的模型部署和环境依赖往往是最大的瓶颈。
硬件内置了开源项目 AIMA / imma (AI-Inference-Managed-by-AI) 模型部署平台。
*tips:AIMA 是一个基于 Go 语言研发的零依赖单二进制边缘 AI 部署管理框架。*

它具备异构硬件零配置自动识别(兼容主流显卡)、YAML 配置文件驱动以及开箱即用的离线优先能力。
在比赛现场,AIMA 结合底层 vLLM 高性能推理引擎,仅凭单个二进制文件就迅速完成了本地硬件检测、模型服务挂载与标准 API 暴露,提供了快速接入的能力。
配置页面也是图形化界面,很方便进行部署。放几张截图给大家了解:



03 | 4 大模型盘点:基础能力与任务映射
逐一拆开来看,每个模型在项目里承担的角色和作用。
① Qwen3.6-35B-A3B
主模型我们选用了阿里的 Qwen3.6-35B-A3B 多模态大模型。
总参数量高达 34.1B(341 亿),但由于采用了 MoE 混合专家架构,单次生成仅激活 2.9B 参数。
为了保证用药管理场景下的识别精度,使用了 BF16 全精度 格式(文件大小约 71.9GB,显存占用 70GB+)。
Qwen3.6-35B-A3B 在项目里承担了三个核心任务:

开始前,为了确保能跑的起来,还跑了一轮 benchmark 测试:

几轮测试下下来,在开启 thinking 的状态下,平均输出在 20 - 70 tokes/s。
② Qwen3-ASR-1.7B
为解决老年人打字难的问题,我们引入了 Qwen3-ASR-1.7B 离线语音识别模型。
它的参数量为 1.7B,特点是显存占用极小、识别延迟低,且具备出色的抗噪与方言容错能力。
产品的语音输入和识别,交给它完成。下面是模型能力与功能实现映射图:

③ Qwen3-TTS-0.6B:0.6B 轻量化语音合成引擎
有了输入自然少不了输出,我们选用 Qwen3-TTS-0.6B 作为语音合成引擎。
参数量仅为 0.6B,计算开销低,支持快速的音频流渲染。
前台的 大音量语音播报,由它搞定。下面是模型能力与功能实现映射图:

④ CosyVoice2-0.5B:0.5B 拟人化自然音色渲染引擎
经测试,Qwen3-TTS-0.6B 的语音播报能用,但音色太机器人了。
为了让播报听起来更自然,我们又单独安装了参数量 0.5B 的 CosyVoice2-0.5B 情感语音合成模型。
这个模型生成语音,更自然温情、带有人情味的语气。
确定在项目里 CosyVoice2-0.5B 为主,Qwen3-TTS-0.6B 为辅。
05 | 压测数据实录:首字延迟 219ms 与 26 tokens/s 吞吐
① 首字延迟 (TTFT) 219ms:秒级视听唤醒体验
我们在现场对跑在 vLLM(127.0.0.1:8000)上的 Qwen3.6 主模型进行了真实 Benchmark 压测(10 轮并发 1 压测)。
测试结果让人惊艳:首字延迟(TTFT)P50 为 219 ms,P99 233 ms,变异系数低至 2.21%。
这意味着用户话音刚落,在不开 thing 的模式下,能秒级做出响应。
② 逐字生成 (TPOT) 与吞吐量:26.02 tokens/s 稳如磐石
在生成速度方面,逐字耗时(TPOT)P50 达到了 37.7 ms/token,整体生成吞吐稳定在 26.02 tokens/s。
下面是我们在现场测得的完整 Benchmark 数据表:

总的来说能用,但你也别有过高期待。
写在最后
这 48 小时的极简架构实践里,我最大的感受是:本地化模型部署想要大面积普及,还有很长的路要走。已知的两个卡点:
- 硬件算力价格贵
- 小模型的推理能力弱
从需求端来说,不管是个人还是企业,确实有针对数据安全性和长期成本的考量。回看 PC 发展的历史,我们能大概得出一个可能的结论。
未来硬件算力持续提升,但价格会持续的下降,不会长期维持在高位,否则进入千家万户的普及时刻就没法到来。同时,小模型用更小的体积、参数、算力需求,持续提升推理时的速度和智能表现。
当这两个条件都具备的时候,那么全民私有化部署模型的时代,就真的来了!
最后,希望本文能给正在探索端侧 AI Agent 落地和本地模型部署的技术朋友们提供一些真实的参考。
欢迎在评论区一起交流探讨!
提交反馈
图文4 模型吃满 128G 显存!本地部署模型前,我劝你先看清手头硬件的真实上限!