背景
这次的工作一方面是为了研究声网,另一方面也尝试用更多的AI架构,在更多的AI工具帮助下去做企业投资研究。声网本身处于一个非常细分的技术领域,该领域的知识和信息都在比较小的范围内传播,加上To B的生意有较高的理解门槛。对RTC的研究过程本身很有趣,同时可以琢磨一些更好地利用AI的认知和执行力的技巧,也体会到一些 AI 在投研工作中的局限性。我还在尽可能客观地认知这家企业,正反面观点都分享出来,不构成投资建议。
声网核心逻辑
正面观点
风险点
- 在AI显著降低软件开发成本的时代,RTC服务必须做得更深更精才有商业上盈利的空间。独立RTC服务商面临开源软件向上蚕食市场,大厂低成本RTC向下挤压生存空间的尴尬情景。
- AI 语音爆发式增长,但对通信层基础设施的需求与直播电商、社交等有差异,声网高并发场景的竞争优势可能不契合AI语音需求。
- 投资了约2.77亿美元建设上海总部办公楼,但预估财务的回报率比较低。需要考虑未来在中国经营企业的隐性成本。
RTC需求恢复增长
对RTC的需求,在疫情阶段受益于电话会议,以及大家居家办公和娱乐得到了快速增长,在那段时间也有大量的资金流入这个市场。
比如声网,在 20 年上市的时候,以 20 美元每股进行了融资,并且超额发行股份,总计的融资金额是4.025亿美元。在上市第一天的收盘价达到了44.99美元,折合市值大约50亿美金。Zego这家中国RTC公司在20年11月融了5000万美元,市场推测的估值大概在4亿美元出头。他们在22年又融了一个亿美元,不清楚估值。同时期的海外,Zoom 股价大幅增长,一些大的公司(比如说 Amazon)也在切入这个细分领域。
2023年以后,这个行业的竞争开始趋冷。除了因AI而崛起的LiveKit还有几轮融资,其他企业基本上没有新的融资轮次,并且一些小型的RTC服务商开始关停或者迁出这个行业。
在需求端,实际上这几年下来,从声网的数据来看,是分钟数增长,但是实际收入下滑的情况,也就是量增价跌。从近两年来看,一方面,AI 语音的增长带来了 RTC B 端开发者工具包下载量的爆炸式增长。
比如用于构建实时语音 AI、电话机器人及低延迟多模态交互服务的livekit npm代码库的下载量大幅增加。这个数据跟现在AI创业浪潮有关,大部分产品可能处于demo等初始阶段,还远远没有到稳态经营的时候。AI的代码能力也显著降低了许多创业者的技术门槛。

另一方面,海外的直播电商以及社交娱乐的需求在稳定爬升。比如eMarketer预估的美国直播电商交易额。Tiktok live的兴起,也使得这个直播电商行业出现了用户需求的增长。涌现了像Whatnot这样的独立直播电商平台,增长非常的可观。

RTC供给端的变化
供给端也出现了很大的变化,简单来看,可以分成下面三个阶段。
- 第一阶段(2020-2021):Zoom Video SDK、Azure Communication Services、华为云SparkRTC、100ms、Dyte和LiveKit。疫情导致通信需求激增,比如电话会议、在线教育场景。
- 第二阶段(2022-2023):火山引擎、StreamLake、Cloudflare、Dolby/Millicast、Mux和AWS IVS。场景扩展到直播电商、互动观看。
- 第三阶段(2024以来):没有新进入者,但几乎所有原有RTC服务商都在向AI语音扩展。其中Livekit转型的最好。
比如 LiveKit 就是这两年来最大的供给变量。他们把开源作为一种商业策略,扩大漏斗的顶端入口,吸引足够多免费使用他们代码库的开发者去进行 AI 产品、语音产品的开发;同时把 LiveKit Cloud 作为商业化漏斗的窄端来寻求收入。他们的产品也非常契合现在 AI 语音的需求特性:
- 低延迟,但不需要太高的并发能力。
- 接入AI模型,在前端降噪、流程编排等AI语音环节提供价值。快速降低开发者的开发门槛。
- 价格上对比传统的RTC服务商在创业者起步阶段有优势。
另一方面,Livekit作为OpenAI比较公开的AI语音基础设施合作方,两者在AI语音领域发展的历史变化,本身也体现了独立RTC服务商的生存空间有限。
AI对RTC领域的影响
这篇文章里我列出了一些提供RTC服务中要解决的问题,对哪些AI可以大幅提效和解决、哪些暂时还比较困难做了些区分。但我不是这个领域的技术专家,一定有错误的地方。
简单来说,AI带来数据中心基础设施的大幅增加,在硬件层面使得不需要专门建设基建,蹭一蹭其他主流需求的基建边角料可能就够满足RTC需求,意味着云厂商可能愿意白送低难度的RTC服务。其次,开源RTC服务增加,原因跟AI显著降低了软件层开发成本有关,在软件层的组装成本也大幅降低。一个资深RTC技术专家的价值在这个时代会被AI显著放大,原来需要一个团队几个月工期的RTC搭建,现在可能一个专家+熟练运用AI就能完成。
但在部分场景需要很深的RTC技术服务,比如跨地区、弱网、高并发条件下的RTC,涉及到长期的纠错积累、私有数据,这部分门槛依然较高,不是AI可以简单替代的工作。
声网的竞争
在这个行业内从公开信息较少,需要从各种线索里探究声网的竞争优势的。往往只有初级阶段的创业团队会公开发表声音,但这些企业由于需求特性又不是声网的主要营收来源。作为潜在的创收来源,也有一定的参考价值。从一些迁出记录里能看到创业团队离开声网的原因主要有需求特性不匹配、价格太贵等。
而真正有高并发、弱网、互动等需求的中型以上企业,往往不会在公开的信息中发表自己的体验和决策权衡。虽然声网提供部分案例,但我在给权重时对自家营销案例给得低。目前看到最能说明声网竞争优势的案例是Whatnot自己技术博客里的一篇文章,从中可以看出声网在大规模互动直播领域的竞争优势。看这个案例不禁遥想YY当年在魔兽世界屠城战时上千人在一个语音频道的盛况。
直播电商这个场景非常符合声网的竞争优势,Whatnot作为近几年在美国快速增长的直播电商平台,融资和估值逐步抬升,开始向欧洲市场扩展。他们专注于做好直播电商运营,没有Tiktok那样的基建能力,跟声网可能会有比较长的蜜月期。并且这个场景在欧美的兴起,也会给声网带来比较稳健的增长。
Whatnot融资轮次和估值情况:
| 时间 | 融资轮次 | 融资金额(美元) | 公开估值(美元) | 备注 |
|---|---|---|---|---|
| 2020年12月 | Seed(种子轮) | 约 $4M | 未披露 | YC、a16z 等早期投资者参与 (The Brand Hopper) |
| 2021年3月 | Series A | $20M | 未披露 | a16z 领投 (Clay) |
| 2021年5月 | Series B | $50M | 未披露 | YC Continuity 领投 (Clay) |
| 2021年9月 | Series C | $150M | $1.5B(15亿美元) | 成为独角兽,估值首次公开披露 (TechCrunch) |
| 2022年7月 | Series D | $260M | $3.7B(37亿美元) | 估值较 Series C 翻倍以上,由 DST Global、CapitalG 等领投 (TechCrunch) |
| 2025年1月 | Series E | $265M | 约 $4.97B(约50亿美元) | 新融资推动估值接近50亿美元 (The Information) |
| 2025年10月 | Series F / 新融资 | $225M | $11.5B(115亿美元) | 公开报道显示该轮融资后估值达到115亿美元 (The Information) |
经营情况好转
公司在行业繁荣期上市,IPO融资金额都超过当下市值。膨胀期在各个方面都做超额的开支,比如:
- 员工人数在2021年高达1311人;
- 2022年花了约1.77亿在上海杨浦区买地盖办公园区;
- 持续到2024Q3的高额股权激励;
繁荣期资本市场也看到RTC行业的潜力,愿意投钱。比如Zego即构,在2020年融了腾讯、IDG、启明等的5000万美元,2022年融了1.02亿。都说明竞争烈度在未来会上升。叠加国内经济大环境从2022年以来的退坡,声网的营收在上市后首份财报(2021Q3)即迎来历史最高值,后续一直下滑到2024Q3才见底。
在2024Q4,声网海外收入首次超过境内,从有鱼的地方钓上了鱼。2025Q2、Q3两个季度,海外DBNRR分别是108%、109%。我认为在国内高度市场化的行业里,比如电商、数码、汽车等,头部的企业和管理层都是世界级的。在国内这个地狱级的试炼场打怪升级后,需要到海外去找战利品/利润。
2025年员工人数裁撤到剩余543人,比峰值下降58.6%。股权激励从2024Q4开始控制在季度$200万以内。经营利润虽然还处于亏损,但大幅收窄至盈亏平衡线附近。
AI、语音、声网
STT模型 (Speech to Text) 让机器设备可以更准确地接收人的语言,LLM模型让机器更好的理解人的信息,这些都会大幅改变人和电脑、手机的交互方式。Vibe coding中语音输入越来越成为重要的写代码方式,当体验过便捷的语音输入、AI协助编排等功能之后,再回到打字输入会非常难受。目前在短词、口音、语言切换时上还经常会出错,但动态来看大部分问题都会解决。一块大的触摸屏,加上一个好的麦克风,可能会是未来生产最主流的方式。
当下AI大幅降低了写代码的门槛,软件创业的门槛大幅降低。随着上述AI对语音非常好的支持,AI语音领域的软件创业大概率会涌现。音视频的实时传输成为绕不过去的基础服务,声网的sdk下载量也有不小的增长(数据图)。短期在声网财务上,大概率体现为成本增长大于收入。因为相当多的创业团队会使用每月免费的10000分钟额度,并且相当多的新产品可能会倒在给声网创收之前。

长期AI会对软件行业带来深远的影响,由于现在进步速度太快,实在难以看清。声网的RTC服务在高并发、弱网等细分场景的优势,很大程度也是软件层面的工程能力,但这里面离不开长期的实践经验、数据积累,AI或许需要相当长时间的进步才能逐步赶上。
一些畅想
AI会显著降低数字资产的成本,大家可见的有现在抖音上非常高质量的AIGC。我最近尝试了用Tripo生成3D模型,质量很高,成本比Unity商店里卖的还便宜。未来数字资产的大幅增长,可能让原来不可为的事情变得可为。原来找一个3D建模工程师,需要消耗不少的工期才能建立一个高质量的模型放入电影或游戏里。想起曾经Meta的VR元宇宙落地效果,低龄化的虚拟形象、卡通的场景环境实在没有吸引力。到现在VR、3D游戏的成本仍然因为投入回报率不得不大幅降低质量,比如可能看到游戏里路边小猫的样子都一模一样,因为游戏制作商都在Unity花$50买的同一个3D模型,他们不可能为了一个环境元素找一个建模工程师专门来做。但在AI的降本提效促进下,VR资产质量和体验可能会显著抬升,大量用户在一个高质量VR空间里实时交谈交互,那时候对RTC基建的需求量可能十分巨大。