
作者丨晨阳
编辑丨小龙
当“会说就会写”不再是修辞手法,而成为数亿人每日的交互现实时,一个千亿级赛道正以前所未有的速度重构人机交互的底层逻辑。
近日Wispr宣布完成2.8亿美元Series B轮融资,由Menlo Ventures领投,Notable Capital、NEA、Neo Ventures、8VC、MVP Ventures等老股东持续加注,新晋投资者包括Acrew、Activate、Forerunner、Goodwater、Peak XV、Together Fund和PLUS Capital。

本轮融资后公司估值达到20亿美元,累计融资额攀升至3.61亿美元。
而就在不到一年前,2025年11月,Wispr刚刚以7亿美元估值完成2500万美元A轮追加融资,不到一年估值翻近三倍。
更值得关注的是,这家公司的核心产品Wispr Flow并非诞生于一帆风顺的坦途——它曾是一家烧掉1400万美元做“读脑耳机”的硬件公司。
从40人团队骤降至5人,从2000多平米的办公室到空荡的工位,再到今天坐拥数百万月活用户、触达《财富》500强中270家企业的AI语音独角兽——Wispr Flow的故事,既是硅谷创业精神的缩影,也是AI应用层如何找到产品市场契合点(PMF)的经典样本。
01从“读脑耳机”到AI输入法
Wispr的故事,始于一个看似疯狂的愿景。
2021年,斯坦福大学毕业生Tanay Kothari和Sahaj Garg共同创办了Wispr。

Kothari在德里长大,青少年时期就展现出惊人的产品天赋——2011年至2015年间,他接连发布了七款移动和桌面应用,涵盖语音助手、安全工具和教育领域,累计吸引来自17个国家超3万次下载。
进入斯坦福后,他主修计算机科学,专注于人工智能与机器学习,后在Andrew Ng的深度学习课程CS230担任助教,并在斯坦福AIMI实验室参与医疗AI研究,其关于CT影像肺栓塞检测的研究成果发表于《npj Digital Medicine》。
他还创办过音乐智能平台Convert.cc,在零营销投入下做到月活250万用户。
此后他创立FeatherX,一家电商个性化平台,被Cerebra Technologies收购后他担任产品负责人和工程负责人。

这些履历让他跻身2023年福布斯30 Under 30榜单。
联合创始人Sahaj Garg同样是斯坦福工程学院的优等毕业生,后在光子计算公司Luminous Computing负责AI团队。两人还是大学室友。

他们最初的创业想法直接源于一个“未来科技问题”:如果未来人类都要通过语音与AI交流,难道要每天在办公室、地铁和咖啡馆里对着手机讲话吗?既不体面,也没有隐私。于是他们决定做一件更激进的事——不把声音说出来,而是通过可穿戴设备捕捉人在“无声说话”时产生的神经信号,再转化为文字或声音。
这个想法听起来像是《钢铁侠》里贾维斯的现实版——而Kothari从小就是贾维斯的狂热粉丝。
他们花了大约半年做出第一个原型,随后拿到融资,组建了包含神经科学、机器学习、信号处理博士在内的40人团队。他们真的把“读脑耳机”做了出来——一种通过神经信号识别“无声说话”的交互设备。
然而,三年烧掉1400万美元后,现实给了他们一记重锤。硬件研发周期漫长、成本高昂、商业化路径不明——这些问题让Wispr走到了悬崖边。
2024年7月18日,Wispr彻底停止了硬件设备的研发。40个人的公司,几乎一夜之间缩到5个人,2000多平米的办公室空空荡荡。
但正是这次断臂求生,让Wispr迎来了真正的转机。
团队将全部精力投入到此前为硬件配套开发的语音输入软件——Wispr Flow。

2024年10月,Mac版上线;2025年3月,Windows版发布;同年6月,iOS版推出;2026年2月,Android版正式上线。
从一个硬件公司的“附属软件”,到覆盖全平台的独立产品,Wispr Flow仅用了不到一年时间。
这期间,Wispr完成了多轮融资:2025年6月,3000万美元A轮,Menlo Ventures领投;2025年11月,2500万美元A轮追加,Notable Capital领投;再到2026年8月的2.8亿美元Series B。
从濒临倒闭到估值20亿美元,Wispr只用了两年。
02让“说话比打字快4倍”成为现实
Wispr Flow的核心功能极其简洁:用户按住快捷键说话,松开后语音内容自动出现在鼠标所在的输入框中,无需切换应用,几乎适用于所有软件。
据称,用Wispr Flow输入比手动打字快3-4倍。
但真正让Wispr Flow脱颖而出的,不是“转录”本身,而是“零编辑”。

传统语音转录工具的核心指标是“单词错误率”(WER),而Wispr Flow的目标是“零编辑率”——用户说话结束后,输出的文本不需要任何手动修改即可直接使用。官方数据显示这一比例超过80%,而用户反馈实际体验接近100%。
这一体验背后是两重技术支撑:
第一,意图驱动转录。Wispr Flow深度理解用户意图,自动删除填充词、修正语义错误、自动添加标点符号,最终生成结构化、符合语境的文本。公司还建立了个性化的“专属字典”,能够消化用户的行业术语、俚语甚至个人表达习惯。
第二,系统级集成与超低延迟。Wispr Flow在操作系统层面运行,支持110多种语言的零延迟转录,跨平台兼容Mac、Windows、iOS和Android。用户无需在应用间切换,Flow直接在系统层级工作。
2026年8月,伴随本轮融资,Wispr发布了首款自研语音模型Canto。
Canto能在最困难的测试条件下将单词错误率从30%以上降至5%-10%,并将日常听写中需要编辑的比例降低30%-35%。
Wispr声称其整体错误率约为10%,低于OpenAI Whisper的27%和苹果原生转录的47%。
截至2026年8月,用户通过Flow已写下超过600亿单词。用户下载六个月后仍有80%保持活跃,其中一半以上用户已用Flow完成超70%的文字输入。
付费转化率高达19%。月收入环比增长60%,年收入已达380万美元。用户基数同比增长100倍,12个月用户留存率达70%。
公司已触达《财富》500强中的270家企业,并与125家企业签订企业客户协议。产品被“几乎所有”《财富》500强公司和超1万家企业使用。
Wispr于2026年8月,还推出了首款非听写新产品——AI会议记录助手Notetaker。

该产品可一键录制会议、生成实时转录和对话摘要,并提供会前简报、会中“我错过了什么”按钮、会后按主题组织的详细纪要等功能。
Notetaker还能与Anthropic的Claude和OpenAI的ChatGPT等AI助手通过模型上下文协议集成。
03谁在争夺“后键盘时代”的入口
语音输入正在从“辅助功能”蜕变为AI时代的核心交互范式。
据第三方机构测算,2026年全球AI语音识别市场规模已达412.7亿美元,预计2030年将突破780亿美元;全球语音与语音识别市场则从2025年的190.9亿美元增长至2026年的237亿美元。
与此同时,全球约有84亿台活跃的语音助手,超过一半的智能手机用户每天都会进行一次语音搜索,约32%的消费者已养成用语音而非打字进行搜索的习惯。在这场争夺战中,一批从不同角度切入的玩家正在重新定义“输入”这件事。

智谱AI则是国内大模型厂商中率先将语音识别能力产品化的代表。
2025年12月,智谱发布并开源GLM-ASR系列语音识别模型,同步推出基于该模型的同名输入法(产品代号AutoGLM,昵称"小凹"),包含云端高精度模型GLM-ASR-2512(字符错误率低至0.0717)和参数量仅1.5B的端侧模型GLM-ASR-Nano-2512。

产品并非简单的"语音转文字"工具,而是将大模型能力深度嵌入输入框——用户可在语音转写基础上直接完成翻译、改写、情绪转化、人设风格切换等操作,还支持Vibe Coding语感编程和针对公共场景的"耳语捕捉"功能。
另一款值得关注的国内产品是闪电说。
这款基于本地AI处理的语音输入法选择了与讯飞听见截然不同的路径——端侧优先。通过端侧计算架构,闪电说实现了毫秒级响应(延迟小于200ms),输入速度可达每分钟220字。它支持离线语音识别,兼容普通话、粤语、英语、日语、韩语等多语种,并采用本地处理技术保障用户隐私数据不离开设备。
更独特的是,其内置AI引擎可自动优化句子结构,甚至支持Python、Java、C++等编程语言的语法识别与符号补全。闪电说走的是“隐私流”——完全本地处理,支持自定义AI模型。
海外市场同样不乏值得关注的玩家。
Typeless是近期在独立开发者圈子里快速蹿红的一款AI语音输入工具。
它完全抛弃了传统输入法的皮肤、词库等概念,只有一个菜单栏图标。其核心理念是“自然地说话,Typeless就能将你的语音实时转化为清晰流畅的信息、邮件和文档,读起来就像你精心打字一样”——速度声称比打字快6倍。

Typeless支持100多种语言,能自动去除“嗯”、“啊”等语气词、检测并去除重复词语、根据应用场景自动调整语气和风格。隐私方面,Typeless承诺零云端数据保留、绝不使用用户数据进行训练。
这款由华人开发的工具在Product Hunt上线后连日高居排行榜前列,显示出极强的产品力和用户自传播能力。
Superwhisper由阿姆斯特丹独立开发者Jordi Bruin于2023年初推出的产品,主打“超快速AI驱动的听写,理解你想说什么以及你想怎么说”。

与Wispr Flow的云端优先不同,Superwhisper提供了灵活的AI模型选择——用户可以使用其专有的云端模型,也可以自带API密钥接入OpenAI、Anthropic、Deepgram、Groq等第三方模型,甚至支持本地Whisper模型。
产品支持100多种语言,提供多种内置模式(纯语音转录、格式化文本等),并允许用户创建自定义模式。Superwhisper覆盖桌面和iOS双端。
值得注意的是,截至2026年5月,Superwhisper的公司SuperUltra, Inc.仍为自筹资金运营,未接受外部投资——这在AI创业公司中极为罕见。创始人Chudleigh直到2025年8月才招聘了第一名员工,且决心保持精简运营。
这种“独立开发者+自筹资金”的模式,让Superwhisper在产品和定价上拥有极大的灵活性,但也限制了其规模化扩张的速度。
而在这场创业公司竞逐的背后,科技巨头们早已悄然布局。
谷歌在2026年5月的Android Show活动上正式发布了基于Gemini的AI语音听写功能Rambler,并将其深度集成至安卓原生输入法Gboard中。
微软则在Windows 11中推出了Fluid Dictation(智能语音听写)技术,通过设备端小型语言模型实时修正语法、标点及冗余词,显著提升语音输入流畅度。
苹果在iOS 27开发者测试版中引入了新一代AI听写功能,由设备端“AFM Core Advanced”大语言模型驱动,支持离线运行,能更精确地转写语音内容并实时处理大写字母与标点符号。
字节跳动则于2025年下半年正式推出豆包输入法,将自家AI豆包植入输入法键盘,试图在已被搜狗、讯飞等瓜分殆尽的红海市场中开辟AI时代的新通路。
讯飞听见是这条赛道上最不容忽视的“长跑选手”。
作为科大讯飞旗下以语音转文字为核心功能的明星产品,讯飞听见早在2016年便已面世。产品支持在录音过程中实时语音转文字,覆盖中文、英语、俄语、法语、德语等24种语言以及17个专业领域的效果优化。
2025年财报显示,其APP连续三年毛利增长超60%,新增用户年续订率超过50%,常年稳居各大应用商城语音转写品类榜首。截至2026年3月,讯飞听见累计覆盖用户数已达1亿。作为科大讯飞生态的一部分,讯飞听见拥有母公司强大的语音技术积淀和政企客户资源——但它本质上是一款重度工具型产品,更侧重于录音转写与会议纪要场景。
OpenAI更是将语音提到了战略高度——2025年11月,OpenAI宣布取消独立“语音模式”入口,将实时语音与视觉输出直接嵌入ChatGPT主聊天窗口。用户按住即可边说话边看地图、图表、图片,对话文字转录同步出现。
而语音输入也为ChatGPT带来了巨大的流量增长。
在GPT-4o发布多模态能力和高级语音模式后,ChatGPT的每周活跃用户数在2025年2月突破4亿,相比2024年8月的2亿不到半年实现翻倍,其中1.75亿用户通过移动设备访问;到2025年底,其每周活跃用户数进一步攀升至约7-8亿。
与此同时,ChatGPT的月度网站访问量从2024年夏季的约20亿次飙升至2025年6月的超过50亿次,实现了160%的同比增长。
硅谷的办公室里,“Voicepilling”这个词正在快速传播——它指的是用语音取代键盘输入的新习惯。当AI语音听写工具的准确率已经高到足以让说话比打字更快时,键盘似乎正在变成一件“古董”。但更可能发生的,不是键盘的彻底消失,而是输入方式的一次深度重构——键盘不会消失,但它将不再是唯一的主角。

AI对话框取代搜索框成为新的流量入口,用户在线时长和互联网流量正迎来一轮重新分配。而语音作为最自然、最高效、心理负担最低的信息输入方式,天然就是这一轮流量再分配的核心抓手。
本文为创业邦原创,未经授权不得转载,否则创业邦将保留向其追究法律责任的权利。如需转载或有任何疑问,请联系editor@cyzone.cn。







