上周一个做淘宝女装的朋友跟我吐槽,说他上一个拍摄季花了8600块请模特拍春夏新款,拍了30个款,每个款正面侧面背面三张,一共90张图。
8600块90张,一张接近100块。
而且他跟我说了一个让我挺意外的数据。这30个款里有5个款式后来卖爆了,但模特图里的颜色跟实物有色差,因为他那个模特穿的是工厂寄来的样衣,样衣的颜色跟大货有偏差。有顾客收到衣服之后投诉说「实物颜色比图片深好多」。
我就跟他说,你有没有试过AI虚拟试衣?把你的衣服平铺图丢给AI,让它直接穿到模特身上去。
「这玩意靠谱吗?」
我花了两天给他做了一组对比。同样的衣服,一边是传统模特拍摄,一边是用OOTDiffusion生成的虚拟试衣图。我把两套图混在一起发给他,让他分辨哪张是AI做的。
他选错了4张里3张。
。。。
然后他就认真了,让我帮他把剩下25个还没拍模特图的款全部用AI生成。
我跟他说一个款正面侧面两张收50块,25个款50张,一共2500块。他说行。
我用CatVTON在本地跑的,一张图大概一分半钟。25个款两天搞定。2500块进账,除了电费没有任何成本。
这个市场为什么现在能做
先说个背景。
服装电商的退货率你知道有多恐怖吗?行业平均20%到30%,女装甚至能到40%。线下试衣间退货率只有5%到10%。
中间的差距是什么?就是「我不知道穿上什么样」。
所以这几年虚拟试衣成了一个很热的技术方向。Revery.AI拿了YC S21的投资,做的是B2B虚拟试衣间,HN上103分,评论区都在讨论这个事。法国的Veesual拿了750万美元融资,专门给时尚品牌做虚拟试穿平台。
但这些都是面向大品牌、大平台的SaaS解决方案,起步价就是几千块一个月,小卖家根本用不起。
机会就在这里。
跟AI产品摄影一样,工具本身是开源免费的,但大部分服装卖家不会部署、不会调参数、不知道哪个模型效果好。他们需要一个人帮他们搞定这件事。
而且跟产品摄影不同,虚拟试衣的技术门槛更高,不是打开网页选个模板就能搞定的,所以竞争者少很多,客单价也更高。
你想想看,淘宝上活跃服装店铺少说几十万家,每个店铺每个季度上新几十到几百个款。这些新款都需要模特图。传统拍摄一个季度的成本动辄几万块。你用AI做同样的效果,成本接近零,收费只有传统拍摄的三分之一到十分之一。
这个价差太大了。
核心工具盘点
目前做虚拟试衣,市面上有这几个主要的开源模型。
OOTDiffusion,GitHub上6500多星,AAAI 2025的论文。这个模型的特点是可控性强,你可以分别控制模特的姿态、衣服的款式、以及衣服穿上去之后的效果。它的核心思路是把衣服图像和人物图像分开编码,然后融合生成最终效果。是目前开源虚拟试衣模型里最热门的一个。
IDM-VTON,5000多星,ECCV 2024的论文。这个模型主打「野外场景」,就是说它不要求完美的拍摄环境,普通的街拍照片、日常照片都能用。它解决的问题更实际,因为商家给你的模特图往往不是棚拍,光线和姿态各种各样。IDM-VTON对这种「不完美」的输入处理得比较好。
CatVTON,1700多星,ICLR 2025的论文。这个模型我的推荐度最高,因为它最轻量。整个模型只有不到9亿参数,可训练参数不到5000万,8G显存就能跑1024x768的图。什么概念呢,你一台3060笔记本就能本地跑。速度也快,一张图一分多钟。效果上虽然比OOTDiffusion稍微差一点,但对大部分服装电商的需求来说完全够用了。
还有ComfyUI的工作流。有人把IDM-VTON做成了ComfyUI的自定义节点,GitHub上接近600星。如果你已经在用ComfyUI做AI绘图,装上这个节点就能直接在工作流里调用虚拟试衣功能,跟你的其他AI绘图工作流串联起来,批量处理非常方便。
快手出的Kolors Virtual Try-On也有在线Demo,浏览器直接用,不用部署任何东西,适合完全不想折腾技术的人先体验一下效果。不过在线版的可控性比较差,只能上传衣服图和模特图,不能调太多参数。
我自己实际用的搭配是CatVTON主力出图,OOTDiffusion处理细节要求高的单子,ComfyUI工作流做批量处理。三个工具覆盖了从简单到复杂的所有场景。
硬件和部署成本
这块我得说清楚,因为虚拟试衣跟产品摄影不一样,它确实需要一定的硬件基础。
最低配置,NVIDIA显卡8G显存。CatVTON可以在8G显存上跑,但生成一张1024x768的图需要一分半到两分钟。RTX 3060 12G是性价比最高的选择,二手一千多块,12G显存跑CatVTON绰绰有余,跑OOTDiffusion也勉强够。
如果连显卡都没有呢?用Google Colab。免费的Colab给你T4显卡,16G显存,OOTDiffusion和IDM-VTON都能跑。Colab的免费额度虽然有限,但你接小单的时候完全够用。我自己第一个月就是纯用Colab跑的,没花一分钱硬件成本。
还有一个折中方案,租GPU。AutoDL、恒源云这些平台上租一张RTX 3090 24G,每小时两三块钱。如果你只是偶尔接单,不常驻,租显卡比买显卡划算。
软件环境的话,这些开源模型都是Python的,部署用conda或者Docker,GitHub上有详细的安装教程。CatVTON的仓库README写得特别清楚,照着步骤走,有Python基础的人半小时能搞定。没有Python基础的话,comfyui-workflows上有现成的ComfyUI虚拟试衣工作流,装好ComfyUI导入就行了。
跟我之前帮人建AI网站一样,工具部署本身也是一种门槛,会的人觉得简单,不会的人觉得是天书。正是这种门槛,让你能赚到钱。
操作流程,从接单到交付
我自己的流程,一步步拆给你看。
第一步,需求沟通。客户发来服装图片,可能是平铺白底图,也可能是穿在假人模特上的图,或者是工厂寄来的样衣实拍图。你跟客户确认几个关键信息,要用什么体型什么肤色什么风格的模特、需要几个角度、什么尺寸。淘宝主图一般是800x800正方形,详情页图要更宽一些。
第二步,准备模特素材。这里有个技巧,不用每次都找新模特。我自己收集了一套模特图库,大概30个不同体型、不同肤色、不同年龄段的模特,有站姿有坐姿有行走姿态。客户要什么风格的模特我就从库里选,不用每次现找。这套模特图库是我花了一周时间从Pexels、Unsplash这些免费图库上精心筛选的,质量和一致性都很好。
第三步,模型推理。把服装图和模特图喂给CatVTON,设置好参数跑一遍。第一次跑出来的图通常会有这样那样的小问题,比如衣服边缘有轻微错位、某个褶皱方向不太对、或者手部有点不自然。这些都需要手动处理。
第四步,后期修复。这是拉开你和别人差距的关键一步。不要直接把AI生成的图发给客户。用Photoshop或者在线修图工具修一下边缘、调一下色调、修一下手部。如果衣服上的图案有轻微变形,用液化工具调整。这一步花的时间可能比AI生成还长,但质量上能提升一个档次。
第五步,交付。按客户要求的格式和尺寸导出,淘宝主图、详情页图、主图视频(如果需要的话)。打包发过去,收钱。
一个款,从拿到衣服图到交付两张模特图,熟练之后30到40分钟。其中AI生成占5分钟,后期修复占25到30分钟。
定价策略
这块我一开始也定错了价,走了不少弯路。
最早我在闲鱼挂的是「AI换装图,10元一张」。来了几个客户,每个人发一堆衣服图让你做,做完之后一堆要求改的。算下来10块钱一张,加上沟通和修改时间,时薪可能不到30块。
后来我研究了一下市场行情,调整了定价结构。
单件换装,正面一张30到50元,正侧两张50到80元。适合小卖家偶尔需要几张模特图的情况。
批量换装套餐,20到50件衣服,每件正面加侧面两张,总价1000到3000元。单件折合下来25到40元一张,但批量接效率高很多,因为你用的模特是固定的,参数调好之后批量跑就行。
全品类模特图服务,50到100个SKU,用不同体型和肤色的模特覆盖,每件2到3张图,总价3000到8000元。这个是给有一定规模的服装品牌做的,他们需要模特图用于多个平台、多个渠道,对模特的多样性要求高。我自己接过一个80个SKU的单子,收了5000块,用CatVTON跑了一周。
月度合作套餐,每月帮客户处理新款模特图,固定费用1500到5000元,根据每月款式数量浮动。这种模式我最喜欢,因为收入稳定,不用每次都重新找客户。
目前我的均价在每张图35到50元。一天处理15到20张,日收入500到800。一个月工作20天左右,月收入1万到1.5万。加上两三个固定的月度客户,稳定在1.5万上下。
我知道你会说「这数据真的假的?」。坦率地说,我是从月入一两千慢慢做上来的,前面三个月主要在积累客户和作品集,收入不高。第四个月开始有了两个稳定的月度客户,收入才上来的。如果你现在开始做,前三个月的预期应该是月入两三千,后面逐步往上走。
去哪里找客户
客户来源这块,服装电商和普通电商不太一样,有一些专门的渠道。
1688商家社区是我目前获客最多的地方。1688上大量做服装批发的源头工厂和档口,他们需要模特图挂在网上给下游经销商看。但很多人请不起模特,用的都是假人模特或者手机随手拍。你在1688商家论坛发帖子展示AI换装的效果,附上before/after对比,很容易吸引到这些工厂客户。他们一次下单量很大,经常是几十个款一起做。
闲鱼和小红书也有用,但更适合接散单。闲鱼发「AI服装模特图制作」,小红书发换装对比笔记。小红书上服装类的内容流量很大,一条好的换装对比笔记能引来不少私信询价。
淘宝服务市场是正式渠道,在「模特拍摄」或「商品图片」分类下上架你的AI模特图服务。淘宝服装卖家在后台搜索「模特图」就能看到你。
还有一个渠道很多人忽略了,就是本地服装批发市场。我去过杭州的四季青、广州的白马市场,那里大量档口的老板需要模特图挂在微信朋友圈和抖音上卖货。你直接去档口跟老板聊,给他们看你手机里的换装案例,很多人当场就能拍板。这种线下获客方式虽然效率不高,但客户黏性很强。
Fiverr和Upwork面向海外客户。搜索「virtual try on」或者「AI fashion model」,你会发现有人定价5美元一张,也有人定价50美元。海外市场对AI虚拟试衣的接受度很高,尤其是独立站卖家,他们对模特图的需求很迫切但预算有限。
容易踩的坑
第一个坑,透明和半透明面料。蕾丝、薄纱、雪纺这些面料,AI处理的时候经常出现透视问题,衣服下面人体的轮廓透出来,看起来很诡异。有个客户发来一堆蕾丝连衣裙让我做模特图,我折腾了半天效果都不好,最后跟客户说这几个款做不了,只收了能做的部分的钱。
从那以后我就给自己定了个规矩,透明和半透明面料先试做一张看效果,不行就直接跟客户说。
第二个坑,客户给的模特图质量太差。有一次一个客户发来的模特图是他在朋友圈存的别人发的自拍,像素模糊,光线昏暗,还是斜的。这种图喂给AI出来的结果当然很差,但客户不理解,觉得是你的技术问题。后来我学聪明了,接单的时候就说清楚,模特图由我提供,客户只提供服装图。我自己的模特图库质量有保证,出来的效果可控。
第三个坑,批量出图忘了检查细节。有个50个款的单子,我批量跑完打包发过去。结果客户发现有三张图的衣服Logo是反的,还有一张模特的手指数量不对。我又重新做了四张,浪费了半天。
每张图至少看一遍再发,这个教训我记住了。
跟AI产品摄影的区别和选择
之前我写过AI产品摄影的拆解,有人问我这两个方向怎么选。
说真的,如果你完全零基础,先做产品摄影。门槛低,工具简单,不需要显卡,用手机就能做。先赚到第一笔钱建立信心。
如果你有一定的技术底子,会装Python环境会用命令行,直接上虚拟试衣。客单价更高,竞争者更少,而且服装电商的市场规模比普通电商更大。
还有一点,这两个方向不冲突。很多人是同时做两个的,产品摄影接日常小单,虚拟试衣接服装电商的大单。我自己就是两条线都在做,产品摄影月收入三四千,虚拟试衣月收入一万出头,加起来还不错。
之前写AI房产虚拟布景的时候我就说过一句话,AI视觉服务的核心逻辑都是一样的,用AI降低某个专业视觉服务的成本,然后从中间的价差里赚钱。虚拟试衣、产品摄影、房产布景,底层逻辑一模一样,只是服务对象不同。
这个副业适合什么人
有一点技术基础的人。不需要你是程序员,但你要会装软件、能看懂GitHub的README、遇到报错知道去搜一下。这些能力对很多人来说其实不难,只是从来没试过。
对服装和审美有感觉的人。虽然AI帮你做了大部分工作,但你得能判断一张模特图「好不好看」「自不自然」。尤其是后期修复那一步,需要审美判断力。
有耐心做精细活的人。虚拟试衣不像产品摄影一键出图,它需要调参、修复、重跑。有时候一张图要反复调四五次才满意。如果你没这个耐心,效果就会打折扣。
前期投入的话,如果用Colab方案,成本为零。如果买一块二手3060,一千多块,一个月内能回本。对我来说,这是一笔很划算的投资。
AI虚拟试衣这个方向,说到底就是用开源的免费模型帮服装商家做他们原本要花几千上万才能搞定的模特图。我们的提示词包里有AI虚拟试衣的模型调参指南和批量处理工作流模板,帮你快速上手。
回到我那个做淘宝女装的朋友。他后来算了一笔账,原来每个季度拍模特图花8000多,现在用AI做只要2500,省下来的钱他拿去投直通车了。他跟我说,「早知道有这玩意,我早半年就开始用了。」
磨平一些信息差。