592.前无古人的决策(2 / 2)

周明远伸手点了点小助理额头,继续科普。

「英文有维基百科moncrawl、斯坦福的squad数据集,中文呢?」

「中文的维基百科条目只有英文的零头,中文的自然语言处理数据集几乎空白。」

「这意味著什么?」

「.……意味著什么呢?」

贺敏傻乎乎的跟著重复一遍,可可爱爱。

「如果有人从现在开始系统性地积累高质量的中文语料,未来做中文大模型的时候,所有团队都需要这些数据。」

「哇……听起来还挺厉害。」  女孩子往往难以沉浸在宏大叙事和星辰大海里面。

贺敏也是一样,只能摆出一副不明觉厉的样子。

「不仅如此,做这个不是我们的终点,等我们年营收过亿的时候,还可以是融资手段。」

短短一晚上思考之后,周明远已然胸有成竹。

他心里明白,等到2016年就好。

明年会有一个ai历史上的标志性事件。

alphago击败李世石之后,全球ai投资会进入狂热期。

到那时候,一家靠数据标注年营收过亿,拥有上千名全职标注员、服务几十家头部公司的数据标注企业.……

融资估值只会比纯算法公司更健康。

「年营收过亿?」

「啊?」

「老板你认真的吗?」  前面都还好,就当是自家老板的一时心血来潮。

可听到这里,贺敏直接惊呆了。

「认真的啊。」

「这个工作,跟短视频公司有著很紧密的直接关系。」

周明远翘起二郎腿,单手撑著面颊,另外一只手解锁手机,把屏幕朝向贺敏。

「是吗?」

总算听到自己了解一点的领域了。

贺敏坐直了身子,提高声音。

「数据标注是短视频平台最核心的基础设施之一。」

「短视频平台需要什么样的数据标注?推荐算法最核心的任务是给每个用户打上精准的标签,然后匹配ta最可能喜欢的内容。」

「那你说标签怎么来?」

「这些其实不是算法自己想出来的,是海量的标注数据训练出来的。」  「比如你刷短视频平台的时候看到一个视频,停留了三秒划走了,系统记录了一次弱兴趣;你又刷到一个视频,点赞收藏加转发,系统记录强兴趣。」

「这些行为本身就是一种标注,但你记住,这叫做被动标注,效率低,噪声大。」

「主动标注是平台自己请人看视频、打标签、写描述、分类、去重、筛选敏感内容。」

「到了平台发展的后期,每个视频的标签体系极其复杂。」

「场景类(室内/户外/夜晚/雨天)、人物类(年龄、性别、颜值、著装风格)、情绪类(搞笑/治愈/励志/伤感)、动作类(跳舞/做饭/化妆/健身)、音乐类(bgm识别、卡点节奏)……」

「这些标签不是用户行为能自动产生的,是靠专业标注员一条一条标注出来的数据,再用这些数据训练内容理解模型。」

「等到模型能自动识别了,标注员再去标注更难的边缘案例。」

「继续叠代模型,形成数据飞轮。」

「.……」

听老板聊了整整一下午,贺敏第一次眼睛亮了起来。

她隐隐约约明白了一点点,周明远要做的事情,究竟有什么作用和含义。

2015年这个时间点,抖音还没上线,快手也才刚刚转型成为短视频社区。  两家都没开始大规模做推荐算法,但也不过是临门一脚的事情。

不管是哪家短视频平台,快手也好,日后的抖音微视秒拍也好,第一件事就是解决内容冷启动问题。

一个新视频上传之后,系统怎么判断内容质量?

怎么决定推给谁?

答案就是内容理解模型。

而内容理解模型的训练数据,就是标注数据。

「所以啊,我为什么有自信能做到营收破亿?」

「因为如果我们在这一年,就把数据标注工厂做起来的话,规模和管理能做到行业领先……」

周明远跺了跺脚,眉眼中洋溢著满满的自信。

「要么大家都是我的客户,要么来给我股份,要么拉我一起创业干平台。」

「跑不掉的。」

事实上,这样的商业模式也非常清晰。  短视频公司提供海量视频素材,标注工厂负责标注标签、情绪、场景、动作、音乐等多个维度,按时交付标注结果。

按条收费或按项目收费。

标注的越精准,推荐算法就越强。

算法越强,就越懂用户,用户停留时长就越长,GG收入就越高。

所以标注成本对平台来说不是可选项,是必选项。

更深一层的价值在于垂直领域的壁垒。

通用标注谁都能做,但视频级多维标注需要不少东西。

一个搞笑视频的【笑点位置】标注,需要文化背景和理解能力。

一个舞蹈视频的【动作拆解】标注,需要一定的专业素养。

一条时政新闻的【立场倾向】标注,需要基本的政治敏感度。

这些说难不难,说简单也不算简单。

需要长期积累和培训的能力,简单的众包还真搞不定。  一旦某个团队,在视频标注领域积累了大量的标注标准和培训体系。

后来者想挖人、想复制,成本高的惊人。

所以数据标注跟短视频的关系,本质上是一条产业链的上下游。

短视频平台是数据标注的甲方,标注工厂是数据标注的乙方。

如果这个乙方在2015年就提前卡位,把规模、质量、成本三个维度都做到极致。

那一旦等到短视频大战全面爆发,或者说新军想要扰乱整个行业,数据标注需求会在一年内从零飙升到数亿元的年市场规模。

到那个时候.……

甲方排队等签约,乙方挑客户、提价格、设壁垒。

更长远看,手里有了海量的视频标注数据,训练自己的视频理解模型就不再是天方夜谭。

万一有人想拉人马自己干呢?

进可攻退可守,那都是预期之内的事情。

哪怕不想进军短视频平台抢饭吃,既可以帮平台做内容审核和智能推荐,又可以把ai能力开放给所有想做视频分析的企业客户。  从标注服务升级为ai能力输出。

这个跃迁一旦完成,就不再只是平平无奇的数据标注公司。

而是高贵洋气的,ai基础设施提供商。

最有趣的事情是。

在这个构想里,数据标注只是第一步,是这个商业模式的现金流来源。

真正的星辰大海是用积累的数据和资本,反向杀进大模型赛道。

在周明远的预期里,transformer论文发布是关键节点。

从这开始,nlp领域的范式开始从rnn/lstm转向注意力机制。

谁先在中文语料上用transformer架构做预训练,谁就能定义中文nlp的下一个标准。

要做出一个可用的中文预训练模型,需要三枚龙珠。

足够多的中文语料、足够便宜的算力、知道怎么训练的人。

而到了那个时候,这三枚龙珠周明远应该已经凑齐了。  语料是现成的。

几年积累下来的标注和未标注数据已经是天文数字。

算力可以买。

gpu云伺服器按小时租,aws和阿里云都有gpu实例。

那个时候的人才,自然也不是问题,ai投资热潮之后人才流动性大增。

第一版不需要做到bert那个量级,可以先从更小的模型开始,用更干净的语料、更长的训练时间、更精细的领域适配来弥补参数量的差距。

大模型做出来之后,商业化路径就很简单了。

做api调用,全盘抄openai就完事了。

开放平台,按调用量收费。

中小企业不需要自己训练模型,直接调用api就能获得最先进的中文nlp能力。

这是最标准的平台型商业模式。

一边是开发者生态,一边是模型能力,中间靠api连接。  一旦这个飞轮转起来,后来者就算有更好的模型也很难抢走客户。

因为客户已经在上面积累了大量的调用记录和应用生态,迁移成本太高。

这个模式在若干年后会被openai的gpt-3验证。

api调用收入年化数亿美元,估值暴涨到千亿级别。

时间回调到2015年,这个看似不可能做ai的年份,恰恰是最好的起点。

再过几年,所有投资人和热钱都一股脑涌入ai的时候,先发优势的价值会被卷到无限趋近于零。

现在,这条赛道几乎是完全真空的。

前无古人,后无来者。

举报本章错误( 无需登录 )