家里电脑都别吃灰:英伟达 PAIR 把它们拼成一台分布式 AI 主机

家里电脑都别吃灰:英伟达 PAIR 把它们拼成一台分布式 AI 主机

背景:本地大模型,卡在第一台机器上

这两年本地大模型(LLM)越来越实用:断网能用、隐私不出家门、不用按量付 API 账单。但门槛也很真实——显存。一块 RTX 5090 有 32GB 显存,勉强能跑 30B 量级的模型;更大的模型就得上 DGX Spark 这种 128GB 统一内存的机器,价格自然不便宜。

英伟达 9 月初宣布了另一个思路:与其让一台机器变大,不如让多台机器协作。它推出了开源的「个人 AI 路由器」软件 NVIDIA PAIR(Personal AI Router),把家里的闲置电脑——打游戏的台式机、出差用的笔记本、甚至苹果电脑——连成一个算力池。同一时间,RTX Spark 设备也宣布 10 月开始出货,官方演示用三台机器组网,把一个智能体任务从 18 分钟压缩到 8 分 48 秒。

PAIR 到底是什么

可以把它理解成家庭算力的调度员。PAIR 在每台参与的电脑上装一个服务,服务负责三件事:

  1. 自动发现:同一局域网内的机器互相发现,不用手动输 IP;
  2. 安全配对:首次连接用 6 位 PIN 码建立信任,节点间通信走 mTLS 加密;
  3. 智能路由:你发出去的模型请求会被路由到「装了这个模型、且当前空闲」的节点上。

关键设计是它优先用空闲算力:你在台式机上开始打游戏,它就会自动减少或停用这台机器的算力,不跟你抢。设备加入或离开网络时,资源池会动态调整。

兼容的设备包括:RTX 20 系列及之后的显卡、RTX Pro GPU、DGX Spark 系统,以及搭载苹果 M4 或更新芯片的设备——英伟达顺手把苹果算力也拉进了自己的体系(M3 及更老芯片是否可用,目前官方没有明确说法)。

实际装起来是什么样

PAIR 的安装比想象中简单,官方提供了三个平台的安装包:

  • Windows:下载安装程序一路下一步;
  • Linux:一个 Debian 包,sudo apt install ./NVPAIR-Setup-*.deb;
  • macOS:拖进 Applications 文件夹。

首次启动有个向导页,可以直接帮你装好推理引擎——默认推荐 Ollama,也可以选 LM Studio,或者用自己的 llama.cpp 编译版。然后在节点卡片上点「添加模型」下载模型(比如 qwen4:12b),各台机器配对后,就可以在任意一台机器上发起请求。

对开发者最友好的一点:接口是兼容的。PAIR 在本机暴露两个地址——http://127.0.0.1:1234/v1(OpenAI 兼容)和 http://127.0.0.1:11434(Ollama 兼容)。也就是说,你现有的任何客户端、智能体应用,不用改代码,把地址指过来就行,PAIR 在背后负责分发。

先别激动:它做不到的四件事

了解边界比了解功能更重要,尤其这是个还在 beta 阶段的软件:

  1. 显存不合并:这是最常见的误解。PAIR 做的是「请求路由」,不是「分布式推理」——一次推理只占用一台节点的显存,不能把两块 24GB 显卡拼成 48GB 来用。
  2. 模型要各节点自己下:只有装了目标模型的节点才会被选中当候选,多台机器意味着模型要下载多份。
  3. 只在局域网内工作:没有云桥接,节点都得在同一张网里(局域网发现不通时可以按地址手动添加)。
  4. 只做推理:训练和微调不在它的范围里。

换句话说,PAIR 解决的是「家里有好几台带 GPU 的电脑,但每台都只有一半时间在工作」的问题,解决不了「我只有一块小显卡却想跑 70B 模型」的问题。

玩机党可以怎么玩

这个工具真正有意思的地方,在于它给了旧硬件一个新岗位:

  • 退役游戏本:换新电脑后,旧的那台 RTX 笔记本不用挂二手了,开机放在书房当专用推理节点,跑 7B~14B 的小模型绰绰有余;
  • MacBook:M4 芯片的统一内存架构跑量化模型本来就有优势,接入后就是现成的节点;
  • 按节点分工:大模型(32B 级别)只下在显存最大的机器上,小模型每台都装一份,PAIR 会自动把轻请求分流到小机器;
  • 配合智能家居:官方文档里还支持无桌面环境的终端模式,Linux 小主机可以纯服务方式加入。

另外值得一提的是时间点:今年 DRAM 和 NAND 价格被 AI 数据中心推高(我之前写过内存涨价的来龙去脉),新 AI PC 只会越来越贵。在这种行情下,把已经买到的硬件榨干,比追新机更划算。

总结

PAIR 不是什么黑科技,它就是把企业里常见的「推理网关 + 集群调度」做成了家用傻瓜版。但它踩中了一个真实趋势:轻量化模型越来越强,能跑模型的设备越来越多,而这些设备的算力大部分时间都在睡觉。英伟达的算盘很直白——先让全家桶的闲置算力被利用起来,生态自然就长大了。

如果你家里正好有两台以上的 RTX 电脑或 M4 Mac,可以去看 NVIDIA PAIR 官方文档,从 GitHub 的 releases 页下载安装包试试。记得它还在 beta,生产环境别指望,折腾玩玩正好。

参考:NVIDIA PAIR 官方文档 · 财联社相关报道 · Luca Berton 的 PAIR 上手评测