2026-06-21 · 0→1 落地手册 · 内部决策稿 · 续《数据标注入局判断》

0→1 落地手册:先切哪几个赛道、怎么把客户真正拿下

回答你两个问题:从 0 到 1 先做哪几个刚需领域(客户分别是谁、要不要避开大模型公司),以及用什么渠道触达、怎么转化成付费客户。结论都做了对抗核实——专门去论证"这个赛道其实打不下来",活下来的才留在这份手册里。

1 · 方向确认:对,但比"专家数据"再窄一层

方向确认 · 已收窄

你卖的不是"专家数据",是"经认证的双语中文/跨文化判断数据,按质量计价"

"放弃通用、主打专家数据"方向对,但护城河比"专家数据"窄得多。你拼不过 Mercor/Surge 在通用英语 STEM 上——你要赢的是它们英语精英漏斗结构上拿不到的那一小块:原生(非翻译)中文 + 中英跨文化的偏好 / 评测 / 评分标准 / 红队数据,再用你领途那套验证能力背书。

同时放弃两件事:放弃通用标注,也放弃"更便宜的英语 PhD"这种叙事。中国关联和中立性是当"信任凭证"来卖,不是当"成本优势"来卖。你那张"中国廉价劳力"的牌,对最终交付物几乎不贡献价值——它只配做不碰任何客户数据的非敏感后端(脚手架/格式化/QA)。

2 · 先切哪 3 个赛道

从需求热度 × 是否未被满足 × 你双语优势是否真有用 × 是否避开了 DOJ 中国安全墙/清密要求,四个维度筛下来,给你这 3 个(按优先级),都做了对抗核实:

赛道 1有条件可赢 · 饱和度中

中文 & 中英跨文化 多语种 RLHF / 偏好 / 本地化评测

为什么现在多语种 RLHF 在英语之外被公认稀缺;原生(非翻译)中文的跨文化偏好/习语/安全判断是被点名的空白(arXiv 2511.03939、2509.21798)。Welo/Appen/TELUS 做的是批量语言学,不是"跨文化偏好判断"。全程 DOJ 干净(纯撰写文本,零美国个人隐私)。

客户类型出海到亚太的、拿了融资的垂直 AI / 应用创业公司;需要中文地区覆盖的大企 AI 团队;中腰部厂商(Sapien/Invisible/Pareto/Welo/Alignerr 的自带专家面板)当白标转包买家。入门期避开前沿实验室。

你的优势母语双语 + 中美两侧 PhD 供给 + 领途资质验证 = 恰好是这块的两个卡点(原生母语判断 + 验证)。这是唯一一个你的优势是"结构性护城河"而不是"打折"的赛道。

赛道 2有条件可赢 · 最便宜验证

双语 / 中文 & 跨文化 红队(对抗性提示数据集)

为什么现在2026 被称为"红队需求超过供给的一年",已变成靠专家私下构建对抗数据的问题。中文越狱、语码转换攻击、跨文化危害框架,是美国英语红队的盲区。单条发现报价 $500–$15万+。零隐私暴露。

客户类型商业前沿实验室安全团队(后期、走转包)、大企/垂直 AI 的安全负责人。硬性排除美国政府/国防(清密墙)。

你的优势一个小而精的双语红队小组,产出美国众包写不出的中文/语码转换对抗提示。纯撰写提示 = 完全绕开 DOJ 墙。三个里最便宜、最容易跑起来验证的。

赛道 3有条件可赢 · 饱和度高,口子要窄

中文 / 跨法域 专业文本推理的 评分标准 & 验证器(金融审计 / 法律监管,只用公开/合成数据)

为什么现在金融/法律环境"存在但比代码受重视得少"= 被低估的长尾。真正缺的是大厂做不好的硬骨头:中国 GAAP vs IFRS vs 美国 GAAP 调节、中国 CPA/税务/证券推理、中美双法域法律推理。权威中文基准(CFinBench 9.9 万道 CPA/税/证券题、LexEval、CLaw)都是中国学者建的,不是美国厂商。$50–150/时,随复杂度涨。

客户类型基准/评测团队、学术实验室、金融/法律垂直 AI 创业公司、以及把你当"专业供给小组"的大厂转包。严格限定在公开财报/法条/合成/脱敏案例。

你的优势美国持证 CPA/JD/金融专家(领途找+验证)负责评分标准/奖励信号/标准答案,中国劳力只做 Python 脚手架/环境复制/QC。中美双法域供给是"监管性稀缺"(中国律协不让非公民执业)。卖点是"可验证的领域作者身份 + 可追溯评分标准"。

⛔ 坚决不碰(这几条会埋你)

  • 代码 / agentic RL 数据——最热,但对你是最差选择。护城河是"研究信誉 + 锚定实验室信任"(实验室买的是能塑造 RL 基建演进的"思想伙伴",不是按需environments),这恰恰是你没有、也买不便宜的;代码对错靠执行验证、不靠文化判断,你的双语优势在这里完全失效甚至变负担;实验室还在自建(a16z:"大厂都在内部建 RL 环境")、刻意把供应商商品化压价;赛道预计 2030 年从 ~20 家洗到 3–5 家,你正撞在"洗牌期"而非"形成期"。
  • 通用英语 STEM / 通用标注——正面拼 Mercor/Surge/Sapien/Toloka,输在价格和规模。
  • 美国政府 / 国防——清密墙,中国关联结构性出局。
  • 一切批量美国个人隐私 / 生物特征 / 基因 / 健康 / 精确定位——踩 DOJ 28 CFR Part 202,一次违规毒化你整个信任卖点。
  • 医疗文本临床推理——高价但被资质+信任双重把关、美国患者数据撞 DOJ 墙;推迟到第二阶段(只用美国本地双语 MD、只碰非美患者/考试/合成/已发表病例)。机会真实(Mercor 健康板块只字未提双语/中文 = 那就是缺口),但不是 0→1 起手式。

3 · 客户分型 + 要不要避开大模型公司

你问 (b):是不是该避开大型模型公司、先从中小创业公司做起?是的——而且不止"避开",要跑"双轨",别只走一条。

前沿实验室的门,基本只通过 ~5 家预先审核过的中立 prime 进,对无品牌新玩家结构性关闭(你自己也说实验室关系很浅、入门期拿不下)。所以正确姿势是:

🅰 轨道 A(主攻 · 直客):拿了融资的 AI 应用 / 垂直 AI 创业公司

在非隐私的中文/跨文化文本赛道上找它们。买单角色 = 创始人 / 数据负责人 / 应用 AI 工程师,冷启动 + 温暖引荐就够得着;它们在规模化之前就买"合同制/嵌入式合作伙伴";pilot $5,000–25,000,便宜、无品牌也能赢。

🅱 轨道 B(并行 · 最快现金流):把双语专家小组白标转包给 prime

给需求饱和的大厂供应一个隔离好的、白标的中文/跨文化专家小组 + 验证层——Mercor Explore、Surge、Labelbox/Alignerr(明确接受外部/自带面板)、Invisible/TELUS/iMerit 的合作伙伴计划。借 Scale/Meta 中立性外溢的窗口,用别人的品牌拿到实验室级的量,自己零品牌。代价是毛利被压、终端没有你的 logo,但这是你最快的第一笔收入。

排序:前 90 天目标 = 赛道 1 上拿下 2–3 个创业公司 pilot(轨 A) + 一个 prime 转包(轨 B)。等有了 pilot logo + 质控履历,再"毕业"到六位数项目和大企 AI 团队(那时你的合规姿态反而成了卖点)。医疗推后到第二阶段。

各赛道客户速查

赛道主攻直客(轨 A)转包买家(轨 B)入门期避开
中文跨文化 RLHF/偏好出海亚太的垂直 AI / 应用创业公司;需中文覆盖的大企 AI 团队Sapien / Invisible / Pareto / Welo / Alignerr 自带面板前沿实验室
中文跨文化 红队大企 / 垂直 AI 的安全负责人实验室安全团队(后期经转包)美国政府/国防
跨法域 金融/法律推理金融/法律垂直 AI 创业公司、基准/评测团队、学术实验室把你当"专业供给小组"的大厂真实客户账本/隐私数据

4 · 渠道地图:90 天怎么摸到买家

5 · 转化打法:从接触到付费客户

6 · 90 天行动清单

7 · 风险与红线


赛道对抗核实结论 & 数据来源

每个候选赛道都被单独"对抗核实"(专门论证它打不下来),结论:

  • 中文跨文化 RLHF — 有条件可赢 / 饱和度中 / 部分受限。顶端被 Surge·Mercor·Sapien 锁住,但"原生中文 + 跨文化判断 + 验证"这一窄块结构性未被满足。arXiv 2511.03939、2509.21798。
  • 跨法域法律推理 — 有条件 / 饱和度高。通用法律已被 Mercor 律师线($110–130/时)占住;只有中美双法域窄楔可赢(中国律协禁非公民执业=供给稀缺)。CLaw / LexEval。
  • 跨法域金融审计 — 有条件 / 饱和度很高。Mercor "Finance & accounting" 线 $85–200+/时;只有公开/合成数据上的中美双法域硬长尾可做。CFinBench(9.9 万题)/ IDEA-FinBench。
  • 医疗文本 — 有条件但推迟。Mercor 健康线 $50–250/时却零双语提及=缺口;但美国患者数据撞 DOJ 墙,只能美国本地双语 MD,第二阶段再做。
  • 代码/agentic RL不可赢(no) / 饱和度很高。护城河是研究信誉+锚定实验室信任(你没有),双语优势失效,实验室自建并商品化供应商,2030 年洗到 3–5 家。Wing / a16z / Epoch / Prime Intellect。

本手册由聚焦调研工作流生成(4 维度抓取 + 5 赛道对抗核实,10 个 agent)。数字为区间或快速变化,关键合同/法规/会议日期决策前请二次确认。