前两天在Hacker News上刷到一个帖子,有人花46万配了一套4卡RTX 6000 Pro的机器,跑GLM-5.2本地模型。底下评论最高赞的一个人说了一段话,让我印象特别深。
他说,你们可能忽略了一类用户。有些企业出于合同和隐私条款的约束,根本不能把数据发给第三方。我们就是这种情况,公司的数据共享政策非常严格,任何外部API都不让用。
这句话点醒了我。ChatGPT和Claude再强,你数据要过人家的服务器。对于律所、诊所、金融公司来说,这不行。客户的案件信息、患者的病历、交易数据,发了就违规了。太离谱了,我做了这么久AI相关的副业,居然一直没想到这个缺口。
我之前一直觉得,本地跑大模型这事是发烧友的玩具,跟正经生意没关系。但这个评论加上Jamesob那个本地模型部署指南在HN上拿了396分和200多条评论,让我重新审视了这个方向。
翻了翻数据。Ollama在GitHub上175K星,vLLM 85K星。Qwen3.6-27B可以在两块二手3090上跑,GLM-5.2的量化版可以在4卡RTX 6000 Pro上跑出接近Claude Opus的水平。怎么说呢,本地模型的能力已经不是玩具级别了。
这事确实有搞头。帮这些不能上云的机构搭建私有化AI基础设施,一套收3到15万,月维护费3000到15000,比你想象的有前途。
为什么这玩意有市场
先想一个问题。为什么一个律所不用ChatGPT?不是因为ChatGPT不好使,是因为律师的保密义务不允许。
中国律师法第38条规定的,律师对客户的商业秘密和个人隐私负有保密义务。你让一个律师把他的案件材料、证据摘要、代理词草稿丢到OpenAI的服务器上?这不是技术问题,这是合规风险。
同样的道理。诊所的病历数据受HIPAA(美国)或个人信息保护法(中国)的保护。金融公司的客户交易数据更是红线。政府机构的内部文件更不用说。
说真的,一个律所合伙人想用AI做合同审查、案件分析、法律检索。一个诊所想用AI做医疗文书整理、辅助诊断参考。一个会计师事务所想用AI做财务报表分析。但他们不敢用云端API。
这个矛盾就是你的机会。你帮他们把AI模型部署在他们自己的服务器上,数据不离开他们的网络。他们拿到了AI的能力,你拿到了服务费。双赢。
另一个驱动力是经济账。我算了一笔账,你想想看。一个中型律所20个律师,每人开一个ChatGPT Plus是20美元一个月,一年4800美元。但数据安全问题始终悬在头上。如果花8万块配一台本地服务器,跑一个Qwen3.6-27B或者更好的模型,所有律师共用,数据全在本地。一年不到就回本了。第三年起全是省下来的钱。
之前我聊过帮公司省云API费用的事,但那是降本。本地部署解决的是合规问题,这个价值比省钱大多了。
真实案例,一个律所的部署过程
说一个真实的事。我前几个月帮一个做医疗纠纷的专业律所搭了一套本地AI。
他们面临的情况很典型。所里30几个律师,日常工作要大量查阅医疗纠纷的判例、写法律文书、对比不同法院的裁判标准。他们之前试过用ChatGPT,但合伙人发现有人把患者信息贴进去问了,直接叫停了全所的AI使用。
但他们又迫切需要AI的帮助,因为一个医疗纠纷案件卷宗动不动几百页,人工翻起来太痛苦。
我的方案是这样的。硬件层面,帮他们在办公室配了一台双路服务器,装了两块RTX 4090,总显存48GB。整机成本大约3万8。软件层面,用Ollama做模型管理和推理接口,搭配Open WebUI做一个跟ChatGPT差不多的聊天界面。模型选了Qwen3.6-27B。
部署过程其实不复杂。装Linux系统,装NVIDIA驱动和CUDA工具包,装Docker,拉Ollama镜像,下载模型,配置Open WebUI容器,设置反向代理和HTTPS。核心配置大概两天时间搞定。
跑起来之后的效果。律师直接用本地模型做法律检索辅助,把案件事实描述喂给模型,让它找类似判例和适用法条。虽然Qwen3.6-27B在中文法律场景下不如GPT-4精准,但应付日常的法律文书起草和判例检索已经够用了。最关键的是,所有数据都在他们自己的服务器上,合伙人再也不用担心泄密问题。
这次部署的总报价是6万8(含两年维保),硬件成本3万8,我的毛利3万。之后每个月的远程维护费是2000块,帮他们更新模型版本、排查系统问题。客户很满意,因为比起每年花大几万买某法律数据库的会员,这套本地AI的价值感强太多了。
工具链,你只需要这几样东西
做本地AI部署服务不需要什么高深的技术。这几样工具够了。
Ollama
GitHub上175K星,目前最主流的本地模型运行工具。它的设计哲学就是简单。一条命令拉模型,一条命令启动服务。Ollama甚至不需要你手动配置什么NVIDIA的复杂环境,它会自己检测GPU并配置。支持的模型列表已经超过100种,Qwen、DeepSeek、GLM、Gemma、Llama全都有。我用它做主力推理引擎,原因是它兼容OpenAI的API格式,客户端接入非常方便。
vLLM
85K星的开源推理引擎,比Ollama多了很多企业级功能。它支持PagedAttention技术,能把显存利用率提高2到4倍。如果你的客户要跑大模型(比如GLM-5.2 594B的量化版),vLLM是唯一能稳定跑起来的引擎。它还支持连续批处理和Prefix Caching,对于多人同时使用的场景吞吐量很高。我一般给企业级客户用vLLM,个人和小团队用Ollama就够了。
Open WebUI
一个开源的AI聊天界面,就是把你本地的模型包装成一个跟ChatGPT长得几乎一样的网页。用户不需要跑命令行,打开浏览器就能用。它支持多用户、对话历史、文件上传、RAG(检索增强生成)。对非技术客户来说,这个界面直接决定了他们的使用体验。
硬件方案
Jamesob的指南给了我很好的参考。他把本地AI的硬件配置分成了几个明确的档次。入门级配两块RTX 3090(二手),48GB显存,总投入约2万,能跑Qwen3.6-27B,适合中小团队。进阶级配一块RTX 6000 Pro或A6000,96GB显存,投入约4到6万,能跑DeepSeek-V3的量化版。企业级配4块RTX 6000 Pro,384GB显存,投入约30到40万,能跑GLM-5.2量化版,接近Claude Opus水平。你的核心能力是帮客户选对方案,别让他们买到不需要的东西。
完整操作流程,帮你理清怎么接单怎么做
第一步,客户沟通和需求梳理。先搞清楚几个关键问题。他们有多少人会用?处理什么类型的数据(文书、病历、代码、还是通用内容)?对模型能力的要求有多高(简单问答就够了还是需要复杂推理)?预算范围是多少?有没有IT运维人员?这一步的价值是帮客户建立信任,因为他们要放数据在你的方案里。
第二步,方案设计和报价。根据需求做三档方案。标准档,单卡RTX 4090加Ollama加Open WebUI,适合5到10人团队,报价2到4万。进阶档,双卡RTX 6000 Pro加vLLM加Open WebUI加RAG配置,适合20到50人团队,报价6到10万。企业档,4卡服务器加vLLM加集群配置加高可用方案,适合50人以上或对模型能力要求极高的客户,报价12到20万。每一档都要写清楚硬件配置、软件栈、性能预期、交付时间、维保范围。
第三步,硬件采购和交付。让客户自己采购硬件,你出配置清单,客户买完后送到机房或办公室。你负责上架、装系统、配置网络。这一步需要的基本功是Linux系统安装、网络配置(IP、DNS、防火墙)、NVIDIA驱动安装。核心的坑是GPU之间用PCIe Switch连接时容易出兼容性问题,需要提前确认主板型号和PCIe通道配置。
第四步,软件部署。装Docker,拉Ollama或vLLM镜像,下载模型权重,配置Open WebUI。这一步的核心是把整个部署过程写成Docker Compose文件,以后升级和维护都方便。模型下载是大头,Qwen3.6-27B大概55GB,GLM-5.2的量化版大概150GB,下载时间要看网速,可能要跑一晚上。
第五步,测试和调优。部署完了要测的东西很多。单用户响应时间是不是在可接受范围内(我一般是5到10秒的预期)。多用户并发会不会卡,显存够不够。模型回答的质量客户满不满意,需不需要根据领域做Prompt优化。RAG配置能不能正确检索到客户的文档。跑完这些测试才能交付。
第六步,培训和交付。给客户的IT管理员做一次培训,告诉他们怎么重启服务、怎么看日志、怎么换模型版本。给终端用户做一次简单的使用说明。交付后第一个月每周远程巡检一次,之后按月维保。这一步决定了客户的满意度,也决定了你能不能拿到复购。
整个过程下来,一个标准档的项目大概需要5到7个工作日,从沟通到交付。
定价策略,怎么收钱才能赚到钱
做本地AI部署服务的定价核心是三个字,分层收。
第一层,一次性部署费。按硬件规模和复杂度,标准档2到4万,进阶档6到10万,企业档12到20万。这个费用包含了方案设计、硬件上架、软件部署、测试调优、培训和交付文档。
第二层,月度维保费。部署总价的8%到12%每月。标准档2000到4000,进阶档5000到8000,企业档1万到1万5。包含远程监控、模型更新、Bug修复、安全补丁、性能优化建议。维保费是这生意最香的部分。一次性部署是有限的,但维保费是持续收入。只要客户还用着你的系统,每个月就有进账。
第三层,升级和定制费。客户需要换更好的模型、增加RAG功能、做多服务器集群、集成现有的业务系统。这类需求看复杂度和时间,按500到2000一天的报价来算。有些客户要求把AI接进他们的OA系统或者CRM系统,这种集成项目一单2到5万也很正常。
接单渠道的话。我个人的经验是知乎和LinkedIn最好用。在知乎上回答「律所怎么用AI不泄露客户数据」「企业能不能部署自己的AI模型」,搜索流量非常稳。LinkedIn上直接找律所的信息化负责人或者诊所的IT主管,发一封简洁的服务说明过去。保守一点说,发50封私信能转化2到3个客户。还有一个被很多人忽视的渠道是商会和企业协会。我认识一个人就是通过当地律师协会的年会认识了5个律所的合伙人,当场签了3个意向单。
踩过的坑
做这行快半年了,踩过的坑不少。挑几个关键的说说。
第一个坑,低估了硬件兼容性的问题。我第一单的时候推荐客户买了4块RTX 4090,结果发现4090不支持NVLink,多卡之间的通信效率很低。跑大模型的时候显存分配不均匀,一张卡满载其他卡闲置。。。我当时就愣住了。后来我学乖了,企业级客户一律推荐RTX 6000 Pro或者A6000,支持NVLink和更好的显存池化。个人玩家可以用4090,商用必须用专业卡。这个坑让我多跑了两个星期去调优,差点把客户搞丢了。
第二个坑,客户的期望管理。很多人觉得本地AI应该跟ChatGPT一样好用。但说实话,本地能跑的模型跟Claude Sonnet 5这个级别还是有差距的。我接的第一个客户是个小诊所的主任,他觉得部署好了就能完全替代以前用的云AI服务。我花了很大功夫跟他解释,本地模型在通用知识上不如云端大模型,但在隐私合规这个维度上,云AI永远达不到本地部署的标准。我后来在方案里加了一条「能力对比表」,写明本地部署的优缺点,避免客户预期过高。
第三个坑,维保比部署费时。本地AI系统不像云服务,出了问题是需要你上门或者远程处理的。我遇到过一次Ollama版本升级后API接口不兼容,客户的Open WebUI直接崩溃了。那次我花了整整一个周末远程排查,最后发现是Ollama的新版本改了默认端口配置。从那以后我所有客户的Docker Compose文件都锁了版本号,不经过测试绝不升级。同时维保合同里要写清楚响应时间和紧急处理流程,避免出现半夜被客户电话吵醒的情况。
第四个坑,模型的选择比想象中更重要。不是所有模型都适合所有场景。Qwen3.6-27B在中文场景下表现很好,但在英文法律文书的处理上不如一些专门训练的模型。GLM-5.2的综合能力很强,但占用的显存是Qwen的5倍,硬件成本直线上升。我后来养成了一个习惯,每次接单之前先问清楚客户的主要使用场景,然后用几个候选模型做盲测,让客户自己选。这不仅让客户感受到专业性,也大大降低了交付后的不满率。
最后说几句
7月5号了。一边是云端AI的能力越来越强,Claude Sonnet 5、Claude Science这些产品一个接一个的发布。另一边是企业的数据合规压力越来越大,很多公司开始明确禁止员工在ChatGPT或Claude上输入公司数据。
这个矛盾正在制造一个明确的机会窗口。本地AI部署不是要跟云端AI竞争,而是要填补那个「想用AI但又不敢用云端AI」的空白地带。
Ollama 175K星、vLLM 85K星、Qwen3.6-27B这样的模型二手的3090就能跑。工具和模型已经准备好了,缺的就是有人去做那个桥梁,帮这些有合规需求的机构把AI能力搬进他们自己的服务器。
我之前说过一句话,帮人部署本地AI这事,某种程度上也是在磨平一些信息差。很多律所和诊所的负责人不是不需要AI,而是不知道有本地部署这个选项。
你可以现在就去翻翻你家附近的律所、诊所、会计师事务所的网站。看看他们有没有IT负责人或者信息化部门的联系方式。发一封简洁的邮件过去。试试看。