0→1 落地手册:先切哪几个赛道、怎么把客户真正拿下
回答你两个问题:从 0 到 1 先做哪几个刚需领域(客户分别是谁、要不要避开大模型公司),以及用什么渠道触达、怎么转化成付费客户。结论都做了对抗核实——专门去论证"这个赛道其实打不下来",活下来的才留在这份手册里。
目录
1 · 方向确认:对,但比"专家数据"再窄一层
你卖的不是"专家数据",是"经认证的双语中文/跨文化判断数据,按质量计价"
"放弃通用、主打专家数据"方向对,但护城河比"专家数据"窄得多。你拼不过 Mercor/Surge 在通用英语 STEM 上——你要赢的是它们英语精英漏斗结构上拿不到的那一小块:原生(非翻译)中文 + 中英跨文化的偏好 / 评测 / 评分标准 / 红队数据,再用你领途那套验证能力背书。
同时放弃两件事:放弃通用标注,也放弃"更便宜的英语 PhD"这种叙事。中国关联和中立性是当"信任凭证"来卖,不是当"成本优势"来卖。你那张"中国廉价劳力"的牌,对最终交付物几乎不贡献价值——它只配做不碰任何客户数据的非敏感后端(脚手架/格式化/QA)。
2 · 先切哪 3 个赛道
从需求热度 × 是否未被满足 × 你双语优势是否真有用 × 是否避开了 DOJ 中国安全墙/清密要求,四个维度筛下来,给你这 3 个(按优先级),都做了对抗核实:
中文 & 中英跨文化 多语种 RLHF / 偏好 / 本地化评测
为什么现在多语种 RLHF 在英语之外被公认稀缺;原生(非翻译)中文的跨文化偏好/习语/安全判断是被点名的空白(arXiv 2511.03939、2509.21798)。Welo/Appen/TELUS 做的是批量语言学,不是"跨文化偏好判断"。全程 DOJ 干净(纯撰写文本,零美国个人隐私)。
客户类型出海到亚太的、拿了融资的垂直 AI / 应用创业公司;需要中文地区覆盖的大企 AI 团队;中腰部厂商(Sapien/Invisible/Pareto/Welo/Alignerr 的自带专家面板)当白标转包买家。入门期避开前沿实验室。
你的优势母语双语 + 中美两侧 PhD 供给 + 领途资质验证 = 恰好是这块的两个卡点(原生母语判断 + 验证)。这是唯一一个你的优势是"结构性护城河"而不是"打折"的赛道。
双语 / 中文 & 跨文化 红队(对抗性提示数据集)
为什么现在2026 被称为"红队需求超过供给的一年",已变成靠专家私下构建对抗数据的问题。中文越狱、语码转换攻击、跨文化危害框架,是美国英语红队的盲区。单条发现报价 $500–$15万+。零隐私暴露。
客户类型商业前沿实验室安全团队(后期、走转包)、大企/垂直 AI 的安全负责人。硬性排除美国政府/国防(清密墙)。
你的优势一个小而精的双语红队小组,产出美国众包写不出的中文/语码转换对抗提示。纯撰写提示 = 完全绕开 DOJ 墙。三个里最便宜、最容易跑起来验证的。
中文 / 跨法域 专业文本推理的 评分标准 & 验证器(金融审计 / 法律监管,只用公开/合成数据)
为什么现在金融/法律环境"存在但比代码受重视得少"= 被低估的长尾。真正缺的是大厂做不好的硬骨头:中国 GAAP vs IFRS vs 美国 GAAP 调节、中国 CPA/税务/证券推理、中美双法域法律推理。权威中文基准(CFinBench 9.9 万道 CPA/税/证券题、LexEval、CLaw)都是中国学者建的,不是美国厂商。$50–150/时,随复杂度涨。
客户类型基准/评测团队、学术实验室、金融/法律垂直 AI 创业公司、以及把你当"专业供给小组"的大厂转包。严格限定在公开财报/法条/合成/脱敏案例。
你的优势美国持证 CPA/JD/金融专家(领途找+验证)负责评分标准/奖励信号/标准答案,中国劳力只做 Python 脚手架/环境复制/QC。中美双法域供给是"监管性稀缺"(中国律协不让非公民执业)。卖点是"可验证的领域作者身份 + 可追溯评分标准"。
⛔ 坚决不碰(这几条会埋你)
- 代码 / agentic RL 数据——最热,但对你是最差选择。护城河是"研究信誉 + 锚定实验室信任"(实验室买的是能塑造 RL 基建演进的"思想伙伴",不是按需environments),这恰恰是你没有、也买不便宜的;代码对错靠执行验证、不靠文化判断,你的双语优势在这里完全失效甚至变负担;实验室还在自建(a16z:"大厂都在内部建 RL 环境")、刻意把供应商商品化压价;赛道预计 2030 年从 ~20 家洗到 3–5 家,你正撞在"洗牌期"而非"形成期"。
- 通用英语 STEM / 通用标注——正面拼 Mercor/Surge/Sapien/Toloka,输在价格和规模。
- 美国政府 / 国防——清密墙,中国关联结构性出局。
- 一切批量美国个人隐私 / 生物特征 / 基因 / 健康 / 精确定位——踩 DOJ 28 CFR Part 202,一次违规毒化你整个信任卖点。
- 医疗文本临床推理——高价但被资质+信任双重把关、美国患者数据撞 DOJ 墙;推迟到第二阶段(只用美国本地双语 MD、只碰非美患者/考试/合成/已发表病例)。机会真实(Mercor 健康板块只字未提双语/中文 = 那就是缺口),但不是 0→1 起手式。
3 · 客户分型 + 要不要避开大模型公司
你问 (b):是不是该避开大型模型公司、先从中小创业公司做起?是的——而且不止"避开",要跑"双轨",别只走一条。
前沿实验室的门,基本只通过 ~5 家预先审核过的中立 prime 进,对无品牌新玩家结构性关闭(你自己也说实验室关系很浅、入门期拿不下)。所以正确姿势是:
🅰 轨道 A(主攻 · 直客):拿了融资的 AI 应用 / 垂直 AI 创业公司
在非隐私的中文/跨文化文本赛道上找它们。买单角色 = 创始人 / 数据负责人 / 应用 AI 工程师,冷启动 + 温暖引荐就够得着;它们在规模化之前就买"合同制/嵌入式合作伙伴";pilot $5,000–25,000,便宜、无品牌也能赢。
🅱 轨道 B(并行 · 最快现金流):把双语专家小组白标转包给 prime
给需求饱和的大厂供应一个隔离好的、白标的中文/跨文化专家小组 + 验证层——Mercor Explore、Surge、Labelbox/Alignerr(明确接受外部/自带面板)、Invisible/TELUS/iMerit 的合作伙伴计划。借 Scale/Meta 中立性外溢的窗口,用别人的品牌拿到实验室级的量,自己零品牌。代价是毛利被压、终端没有你的 logo,但这是你最快的第一笔收入。
各赛道客户速查
| 赛道 | 主攻直客(轨 A) | 转包买家(轨 B) | 入门期避开 |
|---|---|---|---|
| 中文跨文化 RLHF/偏好 | 出海亚太的垂直 AI / 应用创业公司;需中文覆盖的大企 AI 团队 | Sapien / Invisible / Pareto / Welo / Alignerr 自带面板 | 前沿实验室 |
| 中文跨文化 红队 | 大企 / 垂直 AI 的安全负责人 | 实验室安全团队(后期经转包) | 美国政府/国防 |
| 跨法域 金融/法律推理 | 金融/法律垂直 AI 创业公司、基准/评测团队、学术实验室 | 把你当"专业供给小组"的大厂 | 真实客户账本/隐私数据 |
4 · 渠道地图:90 天怎么摸到买家
- 第 1–3 周(性价比最高):申请成为 prime 的供给节点。去 Mercor(Explore + AI 语音面试)、Surge、Labelbox/Alignerr 申请,姿态是"提供一个隔离好的白标中文/跨文化专家小组 + 验证层",不是当竞争对手。目标:1–2 个转包关系 = 用别人品牌赚到第一笔钱。
- 第 1–4 周(并行):直接打 BPO prime 的合作伙伴计划。Invisible(invisibletech.ai/partners → 约 demo)、TELUS/Lionbridge、iMerit、CloudFactory。把"美国 PhD 供给"包装成"可碰敏感数据的那一档",中国劳力是隔离的非敏感后端。
- 第 2–8 周:30–50 封定向触达,打创业公司(不是实验室)。给拿了融资的创业公司的 AI 负责人/创始人/应用 AI 工程师,谈 $5k–25k 付费 pilot(中文评测 / 多语种偏好 / 领域 SME 任务)。引荐路径:VC 投后、DeepLearning.AI、斯坦福 AI、YC 的 AI 创始人圈——温暖引荐的转化率远高于冷打实验室。
- 持续(免费):社区在场。在 Latent Space Discord + 每周 LLM Paper Club 里真心帮人;去参加(别摆摊)AI Engineer World's Fair(2026 年 6 月底–7 月初 · 旧金山,日期请再确认),专攻 post-training / 评测 / RL 环境的"走廊社交",约创业公司 AI 负责人 1:1。
- 内容/入站可信度:发 2–3 篇很具体的细分文章——《我们怎么为 RLHF 偏好数据筛双语 SME》《英语流水线在中文评测里会漏掉什么》。亮出领途验证能力 + 双语优势,绝不发"我们做标注"这种通用话术。r/LocalLLaMA、r/MachineLearning、post-training 的 X 圈当"倾听 + 分发"用,不当外呼。
- 中国国内可选车道(只为分散现金流):给中国实验室供中文数据(DeepSeek/Qwen/GLM/Kimi 的需求)整个跑在中国境内、和美国客户解耦。信任溢价低,但能补现金。务必和美国对外实体/数据通道彻底隔离,否则两头不讨好。
5 · 转化打法:从接触到付费客户
- 只做付费 pilot($2k–8k,创业公司),不做"免费+巨量"。选一个你专家无可争议持证的赛道,50–200 条专家评级样本 或 1 套评分标准 + 100–300 个偏好对,1–2 周交付。付费 pilot 转化率约 49%,免费只有约 18%,还能筛掉只看热闹的。若 30 天内签约,pilot 费用抵扣首个 SOW。
- 让买家来定"标准答案集"(gold set),你报 Fleiss/Cohen kappa。每批交付都附:一致性报告(IAA)+ 每标签混淆矩阵 + 具名专家溯源(谁评的、什么已验证资质)。这一份制品就是说服专家级买家的关键——现在已是标配。
- 主动先讲"中国/DOJ"那一页,而不是等被问。一页《数据处理姿态》:美国本地/常驻双语专家碰所有客户数据;中国劳力隔离在非敏感后端、零接触客户原始数据和批量美国隐私;美国实体签约 + 书面数据处理附录;明确排除 DOJ 受管类别和一切政府/国防。把安全/中立当"第一个被证明"的东西,不是最后一个——这是这行第一号的"隐形毁单杀手"。
- 靠质量 + 中立卖,绝不靠价格。"你付的是质量,不是工时";"独立、无大厂控股——你的数据永远不训练竞品"。这直接吃 Meta/Scale 之后的焦虑,对小玩家是免费差异化。
- 证据点排序(从这个顺序往下打):① 可量化质量/IAA vs 买家 gold set;② 可核验的领域专家匹配(具名资质);③ 中立;④ 安全姿态(SOC 2 Type II 进程 + NDA 下能答清子处理方调用链);⑤ 速度;⑥ 价格放最后。
- 定价:模糊的评测/评分标准/RLHF 判断类按专家工时(成本加成)计;定义清晰可重复的标注才按条计。目标抽成 30–40%。别压价——高端定位本身就是策略(Surge 收到对手的 10 倍)。首批创业公司单子低五位数,企业年单约 $9.3 万–40 万+。
- 先落地再扩张:pilot → 单赛道 SOW(月度经常性)→ MSA 总协议下挂多个 SOW。早点把 MSA 标准化,让每加一个语言/赛道是一次快速 SOW 而不是重新谈判。扩张方向:加语言(中文→其他)、用同一套验证能力加邻近赛道、从"标注"往"评分标准设计"→"评测框架设计"爬(毛利更高、更黏)。
6 · 90 天行动清单
- 第 1–7 天:写那一页 DOJ/中国数据处理 SOP + 中立姿态(美国专家碰所有客户数据;中国隔离在非隐私后端)。这是所有渠道的准入资产,先于任何外呼建好。启动 SOC 2 Type II 文书。
- 第 1–21 天:向 Mercor/Surge/Alignerr 申请当中文/跨文化专家小组供给 + 打 Invisible/TELUS/iMerit 合作计划。目标 1–2 个转包签约 = 第一笔收入(轨 B)。
- 第 1–30 天:在赛道 1 立一个小而精的"板凳":点名 5–10 位持证双语中英专家(领途找+验证)随时可上,外加 2–3 位美国 CPA/JD、2–3 位双语红队待命。预先承诺各赛道的具名板凳深度,把"小团队"重新定义成"资深亲自盯"。
- 第 14–60 天:打包 2–3 个小样本数据集证明能力——如 500–1,000 个中文跨文化偏好对、一个中文红队提示包、一套中美金融推理评分标准。同时跑 30–50 封温暖外呼给创业公司 AI 负责人谈付费 pilot(轨 A)。
- 第 30–75 天:转化 2–3 个付费创业公司 pilot($2k–8k),每个都交付 IAA + 混淆矩阵 + 具名溯源制品。用买家定的 gold set,让"证据"是它们自己的。
- 第 45–90 天:发 2 篇可信度文章(双语 SME 筛选;中文评测会漏什么)。参加 AI Engineer World's Fair 做走廊 1:1。立一个标准化 MSA 模板,让赢下的 pilot 不用重谈就转成经常性 SOW。
- 第 75–90 天:复盘 pilot 转化 + 转包量,哪个赛道转化最快就加注哪个,并排上第一个扩张 SOW(用同一套验证能力加第二个语言或邻近赛道)。
7 · 风险与红线
- 楔子塌回廉价套利 = 致命。一旦你飘到"卖便宜人头"或"更便宜的英语 PhD",就输给 Mercor/Surge/Sapien/Toloka 的价格和规模。会说中文的人全球不稀缺——只有"经验证的、有资质的跨文化判断"才是护城河。"卖质量不卖人头"的纪律是生死线。
- 安全/中立尽调失败 = 第一号隐形毁单杀手。买家现在会查到子处理方完整调用链和数据隔离。中国故事弱或讲晚了,就死在 PoC(Gartner:≥30% 生成式 AI 项目在 PoC 后被放弃)。每次都要第一个主动讲。
- 客户集中度 / 关系薄。金融/法律尤其,需求汇集在少数实验室 + 应用层买家,而且它们越来越想直接签专家、绕开供应商;轨 B 还有毛利压缩、终端没 logo 的问题。对策:尽快拿下一个具名锚客户,并在三个赛道间分散。
- DOJ 28 CFR Part 202 范围蔓延。任何任务一旦碰批量美国个人隐私/生物/基因/健康(含 >1 万人的脱敏临床文本)或精确定位/金融 PII,就触墙。严格的书面范围纪律(只用公开/合成/脱敏输入)不可妥协,一次破例毁掉整个信任卖点。
- 中国国内需求是"站错边"的陷阱。中国实验室有更便宜的本地供给,以美国注册创始人身份服务它们会招来同样的中美摩擦。要么和对外实体/数据通道彻底隔离,要么直接不做。
- 金融/法律双语长尾需求薄、项目制、早期营收有上限。断续、早期封顶。别在 pilot 证明有"常备订单簿"之前过度投入;批量保持小而高毛利。
赛道对抗核实结论 & 数据来源
每个候选赛道都被单独"对抗核实"(专门论证它打不下来),结论:
- 中文跨文化 RLHF — 有条件可赢 / 饱和度中 / 部分受限。顶端被 Surge·Mercor·Sapien 锁住,但"原生中文 + 跨文化判断 + 验证"这一窄块结构性未被满足。arXiv 2511.03939、2509.21798。
- 跨法域法律推理 — 有条件 / 饱和度高。通用法律已被 Mercor 律师线($110–130/时)占住;只有中美双法域窄楔可赢(中国律协禁非公民执业=供给稀缺)。CLaw / LexEval。
- 跨法域金融审计 — 有条件 / 饱和度很高。Mercor "Finance & accounting" 线 $85–200+/时;只有公开/合成数据上的中美双法域硬长尾可做。CFinBench(9.9 万题)/ IDEA-FinBench。
- 医疗文本 — 有条件但推迟。Mercor 健康线 $50–250/时却零双语提及=缺口;但美国患者数据撞 DOJ 墙,只能美国本地双语 MD,第二阶段再做。
- 代码/agentic RL — 不可赢(no) / 饱和度很高。护城河是研究信誉+锚定实验室信任(你没有),双语优势失效,实验室自建并商品化供应商,2030 年洗到 3–5 家。Wing / a16z / Epoch / Prime Intellect。
本手册由聚焦调研工作流生成(4 维度抓取 + 5 赛道对抗核实,10 个 agent)。数字为区间或快速变化,关键合同/法规/会议日期决策前请二次确认。