广告
加载中

谁是最佳「嘴替」?搜狗/豆包/千问/Typeless世纪对决!

雷科技AI硬件组 2026-06-09 10:15
雷科技AI硬件组 2026/06/09 10:15

邦小白快读

EN
全文速览

本文对目前4款大模型驱动的PC端AI语音输入法做了横评,给普通用户选择AI语音输入法提供了明确的实操参考。

1. 先明确了四款产品的基础属性:搜狗是老牌国民输入法,集成腾讯元宝大模型,原有用户不用更换输入法,学习成本极低;千问是千问App内的语音输入组件,自带语料规整和总结排版能力;豆包是独立的大模型语音输入法;Typeless是macOS专属的小众语音输入工具,采用收费模式。

2. 各场景测试结果清晰:识别速度上豆包最快,采用实时转写模式还能自动修正前期错误;长文本识别方面,豆包和搜狗不会卡顿,Typeless输出速度快但会自作主张排版;中英混输识别千问和Typeless准确率更高,方言识别豆包表现最好。

3. 选购建议明确:首次尝试AI语音输入,优先选择豆包或千问,原有搜狗用户可直接升级体验,想要功能适中的小众产品可选择Typeless,但需要注意其免费额度有限。

本次横评展现了大模型语音输入赛道的最新发展情况,给布局AI输入法的品牌提供了产品研发和消费趋势参考。

1. 当前行业痛点与趋势:传统桌面端语音输入体验差,错字多、处理慢无法满足用户需求,大模型技术正在重构语音输入赛道,用户对语音替代键盘输入、提升输入效率的需求强烈,赛道增长空间大。

2. 用户核心需求清晰:用户除了基础识别准确率,还需要优化口癖规整、自动纠错能力,同时对长文本输入、中英混输、方言输入都有明确要求,交互模式上实时转写比说完再处理输出的体验更好。

3. 产品竞争参考:目前豆包靠全场景稳定表现胜出,千问胜在集成更多AI能力,搜狗依靠原有用户基础降低了转型门槛,Typeless的收费模式在国内免费产品成熟的环境下难以破圈,品牌可结合自身优势找准定位优化产品。

本次横评披露了大模型语音输入赛道的发展现状,给语音输入相关从业者提供了机会、风险与发展参考。

1. 赛道增长机会:传统语音输入长期体验不佳,无法满足用户需求,大模型赋能之后,AI语音输入的体验已经达到可用程度,用户接受度持续提升,对传统键盘输入的替代空间大,是当前AI落地C端的重要增长市场。

2. 用户需求变化:用户不再满足于基础语音转文字,还需要自动规整口癖、优化文本,同时要求覆盖长文本、中英混输、方言等多种使用场景,交互上更偏好实时转写的模式,对时效性要求高。

3. 风险与机会提示:当前赛道已经形成差异化竞争格局,新入场者做全品类竞争难度较大,需要找准差异化机会;收费模式在国内市场竞争力不足,建议采用基础功能免费、增值服务收费的模式,更容易获得用户。

本次横评展现了大模型技术对输入工具行业的重构,给相关硬件工厂、工具工厂提供了产品研发和数字化转型的启示。

1. 新商业机会:大模型落地语音输入后,用户对语音交互输入的需求快速崛起,传统键鼠、输入外设工厂可以关注配套AI语音交互硬件的研发机会,比如集成快捷语音输入功能的键盘、适配桌面语音输入的专业麦克风等新产品方向。

2. 产品研发需求:用户对语音输入的准确率、输出速度、多场景适配要求很高,尤其是长文本、口音、中英混输场景的适配需求强,工厂在开发配套AI硬件时,需要同步匹配算法优化的需求,保证软硬件协同体验。

3. 数字化升级启示:传统工厂升级产品时,可以参考搜狗的升级路径,给原有产品换大模型技术底层,给用户提供无感升级体验,既降低了用户的学习成本,也降低了工厂自身的升级转型成本。

本文梳理了大模型时代桌面端语音输入服务的行业现状和用户痛点,给AI语音相关服务商提供了行业参考。

1. 行业发展趋势:大模型技术已经成功重构桌面端语音输入赛道,传统语音输入因体验差长期边缘化,大模型赋能后,AI语音输入已经可以满足日常使用需求,行业正处于快速发展阶段,市场需求正在快速释放。

2. 客户核心痛点:现有产品普遍存在不少待解决的问题,包括长文本处理速度慢、特殊场景识别准确率低、交互模式不符合用户使用习惯,部分产品过度干预文本排版,无法满足用户个性化需求。

3. 解决方案优化方向:实时转写加后台自动纠错的模式体验更好,服务商需要强化产品对长文本、中英混输、方言的识别能力,同时可以做差异化定位,给普通用户提供轻量化的输入服务,给有更高需求的用户集成文本规整、总结等更多AI能力。

本次AI语音输入法横评,给布局输入法、AI能力的平台商提供了产品运营和风向规避的参考。

1. 产品升级需求:当前输入法用户已经有明确的AI语音输入升级需求,大模型底层的语音输入是平台产品升级的必然方向,平台需要加快对原有输入法产品的技术升级,适配用户新需求。

2. 功能优化方向:用户更偏好实时转写、边说边出结果的交互模式,平台需要重点优化多场景识别能力,覆盖长文本输入、中英混输、方言识别等用户常用场景,同时强化自动纠错、口癖规整的能力,提升用户体验。

3. 运营风向提示:国内用户对免费基础产品的接受度远高于收费产品,纯收费工具难以突围,平台可采用基础输入免费、增值AI服务收费的模式;对原有用户做产品升级时,采用无感升级的方式比推出全新独立产品,用户接受度更高。

本文提供了大模型落地消费级输入工具的最新产业案例,对AI应用产业研究有较高参考价值。

1. 产业最新动向:大模型已经从通用聊天场景落地到垂直输入工具赛道,重构了长期发展停滞的桌面端语音输入行业,目前赛道已经形成多元竞争格局,参与者包括老牌输入法厂商、头部大模型厂商、独立开发者推出的垂直产品,竞争态势多元。

2. 主流商业模式与产品模式对比:当前有两种主流产品模式,一种是集成在原有输入法中的实时转写模式,代表为搜狗、豆包,优势是时效性强、用户学习成本低;另一种是说完统一处理再输出的模式,代表为千问、Typeless,优势是文本处理质量高,劣势是时效性差。

3. 行业待研究的新问题:目前行业仍存在不少待解决的问题,包括微软苹果的生态墙尚未开放,限制了行业发展,纯收费模式在国内市场适配性差,部分产品过度主动处理文本不符合用户需求,这些问题都值得深入研究。

返回默认

声明:快读内容全程由AI生成,请注意甄别信息。如您发现问题,请发送邮件至 run@ebrun.com 。

我是 品牌商 卖家 工厂 服务商 平台商 研究者 帮我再读一遍。

Quick Summary

This article presents a comparative review of four large language model (LLM)-powered AI voice input tools for desktop PCs, offering clear, practical guidance for general users choosing an AI voice input method.

1. We first outline the core attributes of each product: Sogou, a long-standing popular输入法 in China, has integrated Tencent Yuanbao LLM, allowing existing users to access the new feature without switching输入法, resulting in extremely low learning costs; Qianwen is a voice input component built into the Qianwen app, with native capabilities for text regularization, summarization and formatting; Doubao is a standalone LLM-powered voice输入法; Typeless is a niche macOS-exclusive voice input tool that operates on a paid model.

2. Our multi-scenario testing yields clear results: Doubao delivers the fastest recognition speed, and its real-time transcription mode automatically corrects earlier errors; for long-form text recognition, Doubao and Sogou operate without lag, while Typeless outputs quickly but makes unintended formatting changes; for mixed Chinese-English input, Qianwen and Typeless achieve higher accuracy, and Doubao delivers the best performance for dialect recognition.

3. We provide clear purchasing recommendations: for first-time AI voice input users, Doubao or Qianwen are top choices; existing Sogou users can simply upgrade to access the feature; users seeking a niche option with balanced functionality can choose Typeless, but should note its limited free usage quota.

This comparative review maps the latest development of the LLM-powered voice input track, providing references for product R&D and consumer trend analysis for brands developing AI输入法.

1. Current industry pain points and trends: Traditional desktop voice input delivers poor performance, with frequent errors and slow processing that fails to meet user demand. LLM technology is reshaping the voice input industry, as users have strong demand for replacing keyboard input with voice to boost efficiency, leaving substantial room for market growth.

2. Core user demands are clear: Beyond basic recognition accuracy, users require improved capabilities for removing filler words and automatic error correction. They also have clear requirements for long-form text input, mixed Chinese-English input, and dialect input, and prefer real-time transcription over post-speech processing for a better interactive experience.

3. Competitive insights for product positioning: Doubao currently leads with stable performance across all use cases, while Qianwen stands out by integrating more comprehensive AI capabilities. Sogou lowers its transition barrier by leveraging its existing massive user base, while Typeless’ paid model struggles to gain mainstream traction in China’s market dominated by mature free products. Brands can position and optimize their products based on their own unique strengths.

This comparative review outlines the current state of the LLM-powered voice input industry, providing insights into opportunities, risks and development direction for industry practitioners.

1. Growth opportunities in the sector: Traditional voice input has long suffered from subpar performance that failed to meet user needs. After being empowered by LLMs, AI voice input now delivers a usable experience, with steadily growing user acceptance. It offers huge potential to replace traditional keyboard input, and represents a key growing market for consumer-facing LLM applications.

2. Evolving user demands: Users are no longer satisfied with basic speech-to-text conversion; they also require automatic filler word removal and text optimization. They demand support for multiple scenarios including long-form text, mixed Chinese-English input and dialect input, prefer real-time transcription for its interactivity, and place high value on output timeliness.

3. Risk and opportunity notes: The sector has already formed a differentiated competitive landscape, making full-spectrum competition difficult for new entrants, which need to target clear niche opportunities. Pure paid models lack competitiveness in China’s market; a free-basic-feature with paid-premium-service model is recommended to better attract users.

This comparative review demonstrates how LLM technology is reshaping the input tool industry, offering insights for product R&D and digital transformation for relevant hardware and tool manufacturers.

1. New business opportunities: Following the integration of LLMs into voice input, user demand for voice-interactive input is growing rapidly. Traditional mouse, keyboard and input peripheral manufacturers can explore R&D opportunities for supporting AI voice-interactive hardware, such as new product directions like keyboards with integrated quick voice input, or professional microphones optimized for desktop voice input.

2. Product R&D requirements: Users have high requirements for recognition accuracy, output speed and multi-scenario compatibility, with particularly strong demand for optimization in long-form text, accent, and mixed Chinese-English input scenarios. When developing supporting AI hardware, manufacturers need to align with algorithm optimization requirements to ensure a cohesive software-hardware experience.

3. Insights for digital upgrading: When upgrading traditional products, manufacturers can follow Sogou’s upgrading path: updating the underlying technology of existing products to LLMs to deliver a seamless upgrading experience for users, which reduces both user learning costs and the manufacturer’s own transition and upgrading costs.

This article sorts out the current industry status and user pain points of desktop voice input services in the LLM era, providing industry references for AI voice-related service providers.

1. Industry development trends: LLM technology has successfully reshaped the desktop voice input track. Traditional voice input has long been marginalized due to poor performance, but after LLM empowerment, AI voice input can now meet daily usage needs, and the industry is in a period of rapid development with fast-growing market demand.

2. Core client pain points: Most existing products still have a number of unresolved issues, including slow long-form text processing, low recognition accuracy in niche scenarios, interactive modes misaligned with user habits, and excessive unwanted automatic formatting that fails to meet personalized user demands.

3. Directions for solution optimization: The combination of real-time transcription with background automatic correction delivers the best user experience. Service providers should strengthen their products’ recognition capabilities for long-form text, mixed Chinese-English input and dialects, while pursuing differentiated positioning: offer lightweight input services for general users, and integrate additional AI capabilities such as text regularization and summarization for users with advanced demands.

This comparative review of AI voice输入法 provides references for product operation and risk mitigation for platform operators developing输入法 and AI capabilities.

1. Product upgrading requirements: Existing输入法 users already have clear demand for AI voice input upgrades. LLM-based voice input is the inevitable direction for platform product upgrading, so platforms should accelerate technological upgrades for their existing输入法 products to adapt to new user demands.

2. Function optimization directions: Users prefer the interactive mode of real-time transcription that outputs text as users speak. Platforms should prioritize optimizing multi-scenario recognition capabilities to cover common scenarios such as long-form input, mixed Chinese-English input and dialect recognition, while strengthening automatic error correction and filler word removal capabilities to improve user experience.

3. Operational guidance: Chinese users are far more accepting of free basic products than paid tools, making pure paid tools difficult to succeed. Platforms can adopt a model of free basic input with paid premium AI services. When upgrading products for existing users, a seamless upgrade approach delivers higher user acceptance than launching an entirely new standalone product.

This article presents the latest industry case of LLM integration into consumer input tools, offering high reference value for research on the AI application industry.

1. Latest industry trends: LLMs have expanded from general chat scenarios to the vertical input tool track, reshaping the long-stagnant desktop voice input industry. The track has now formed a diverse competitive landscape, with participants including established输入法 makers, leading LLM developers, and independent developers launching vertical-focused products, creating a pluralistic competitive environment.

2. Comparison of mainstream business and product models: There are currently two dominant product models. The first is real-time transcription integrated into existing输入法, represented by Sogou and Doubao. Its advantages include strong timeliness and low user learning costs. The second is post-speech unified processing and output, represented by Qianwen and Typeless. It delivers higher text processing quality but suffers from poor timeliness.

3. Unresolved industry questions for further research: The industry still faces multiple open problems that require further study, including the ecosystem walls of Microsoft and Apple that restrict industry growth, the poor compatibility of pure paid models with China’s market, and the mismatch between some products’ excessive automatic text processing and user demand, all of which merit in-depth research.

Disclaimer: The "Quick Summary" content is entirely generated by AI. Please exercise discretion when interpreting the information. For issues or corrections, please email run@ebrun.com .

I am a Brand Seller Factory Service Provider Marketplace Seller Researcher Read it again.

雷科技AI硬件组 | 编辑:天星 | 监制:罗超

键盘输入可能真的要过时了。

过去数年里,桌面端语音输入处在一个极其尴尬的境地:系统自带的听写功能反应迟钝、错字连篇,只能沦为「无障碍辅助」;而第三方输入法虽然加入了云端语音识别,但只要遇到口音、专有名词或是逻辑混乱的长句,吐出来的文字依旧惨不忍睹。

用户不得不在「动嘴输入」和「动手重改」之间拉扯,最后还得老老实实敲键盘。

但在近两个月,大模型技术重构了语音输入法:阿里千问上线语音输入功能,豆包手机上备受好评的语音输入带到了macOS,垂直黑马Typeless凭借Agent能力在独立开发者圈子爆火……就连搜狗输入法,也给起语音输入功能换上了全新的大模型底层。

难道传统的键盘打字,真的要被淘汰了吗?为了一探语音输入法的究竟,雷科技挑选了目前市面上最主流、最具代表性的4 款AI驱动语音输入产品,为这些语音输入法准备了一次横评测试。

搜狗/豆包/千问/Typeless

争做PC「Vibe嘴替」

开始测试之前,我们先来看看介绍一下4 款「参赛选手」。

作为老牌国民输入法,搜狗在macOS上的最新版本正式引入了腾讯元宝的大模型能力。在雷科技看来,它的最大优势在于「无感过渡」:搜狗输入法的AI语音输入功能直接集成在了搜狗输入法里面,如果你不用它的语音输入,搜狗输入法和你之前使用的版本没有任何区别。

阿里的千问输入法并不是一个独立的输入法,而是千问App中的一个独立组件。它既可以在千问App中使用,也可以在千问App之外,用千问的能力来执行语音输入。值得一提的是,因背靠千问App,千问语音输入法也拥有千问的语料规整,甚至是总结排版能力。

相比之下,豆包输入法非常的简单,它就是一个拥有大模型语音输入能力的「普通」输入法。在手机上用过豆包输入法,对于电脑上的豆包输入法你一定不会陌生。

至于Typeless则是一款近期在独立开发者圈子里流行的macOS专属语音输入工具。它完全抛弃了传统输入法的皮肤、词库概念,只有一个菜单栏图标。它的逻辑很简单:按住快捷键说话、松开等待,大模型会在后台处理你的录音,输出经过规整或者翻译后的文字。

识别速度各有千秋,

最出色的竟是豆包

对于语音输入而言,速度决定了你「愿不愿意用」,准确度决定了你「用得爽不爽」。为了测试四大语音输入法的识别准确度,雷科技选择了一个「控制变量法」:在固定位置播放先录制好的一段语音,再来看看四款输入法的速度和准确率。

首先是搜狗输入法(以下语料为雷科技关于耳机市场报道的文章:

不过从行业整体发展来看,雷科技认为耳机市场从增量到存量的转型并不会在2025年就戛然而止,可以肯定的是,至少在2026年的上半年,国内耳机市场仍处于这场市场转型当中,在雷科技看来,2026年将是音频新品牌进入主流市场的最后窗口期,AI则是这些耳机新势力的入场券。

从识别效果来看,搜狗输入法做的其实还是不错的,只不过断句处理稍有瑕疵。至于最后那一个「对」字,其实是我录音的时候旁边有东西敲到了麦克风,但是这个声音它并没有做降噪,而是把它当成了正确的文字输入进来。

除此之外,搜狗输入法还有另一个问题:它语音输入的预览窗非常的小,大概只能滚动显示显示不到10个字,提升空间还挺大的。

另外,搜狗语音输入识别速度也比较飘忽不定:有些时候我说完一句话,它隔两三秒马上就能出来;但如果它认为我说的是很长一段文本的话,它必须等我把整段文本都说完才会开始输出,这个过程需要的时间就比较长。

我们再来看看千问的表现(以下语料为雷科技关于耳机市场报道的文章):

不过从行业整体发展来看,雷科技认为耳机市场从增量到存量的转型并不会在2025年就戛然而止。可以肯定的是,至少到2026年上半年,国内耳机市场仍处于这场市场转型当中。在雷科技看来,2026年将是音频新品牌进入主流市场的最后窗口期,AI则是这些耳机新势力的入场券。

千问的语音识别效果我觉得要分两个方面来讨论。首先,它的语音识别准确度是非常不错的,断句也非常的自然,也能看到它会对我的说的话进行一些规整,比如像一些简单的口癖或者说重复的地方它会优化掉。但识别速度方面,如果你说的话比较长,千问的思考时间也会比较长,大概要等3-4秒钟才能出结果。

我们再来看看豆包的语音输入法(以下语料为雷科技关于耳机市场报道的文章):

不过从行业整体发展来看,雷科技认为,耳机市场从增量到存量的转型并不会在2025年就戛然而止。可以肯定的是,至少在2026年的上半年,国内耳机市场仍处于这场市场转型当中。在雷科技看来,2026年将是音频新品牌进入主流市场的最后窗口期,AI则是这些耳机新势力的入场券。

豆包输入法的工作逻辑跟前面提到的其他输入法有点不一样,它采用的是实时转写的模式,我这边一边说,它就会一边在前台转写。这种实时转写的工作模式会让豆包在刚刚开始识别的时候出现一些错字。

但因为它的输入是一个持续推理的过程,只要我后面继续说话,豆包输入法会意识到前面的错误,然后在我松开手完成输入之前自动把这个错误纠正掉。另外,从识别速度来看,有实时转写能力的豆包显然是识别速度最快的一个。识别速度与我说话基本只差两个字的间隔。

最后,我看来看看「洋和尚」Typeless的表现(以下语料为雷科技关于耳机市场报道的文章):

不过从行业整体发展来看,雷科技认为,耳机市场从增量到存量的转型并不会在2025年就戛然而止。可以肯定的是,至少在2026年的上半年,国内耳机市场仍处于这场市场转型当中。在雷科技看来,2026年将是音频新品牌进入主流市场的最后窗口期,而AI则是这些耳机新势力的入场券。

就体验来说,Typeless的表现跟千问有一点点像,采用的都是我先说,然后他再思考,然后再输出结果的模式,并不能像豆包那样子,我边说他边输入。所以在识别速度上,它跟千问一样并不占优。

Typeless准确度尚可,它跟千问一样,有语音规整的能力,可以把我一些口癖或者说语气词,又或者我中途修改的部分,直接应用在输出的文本上,不需要我自己重复修改。

长文本难度大,

边说边转文字体验更好?

其实从上面的测试中我们也能看出来,因为采用的输入模式不一样,像豆包、搜狗这种边说边转录的输入法,和千问、Typeless这种我们说完整段话,它识别、思考、处理之后再输入的输入法,两者必然会在长文本识别上有所差异。

但问题是,这种差异会不会真的影响到我们日常使用呢?比如说我说一长段话,语音输入法会不会过载呢?对此,我们也准备了长文本的测试。

因为搜狗输入法采用的是语音实时转录缓存,之后再用AI对文本进行润色的处理方案。长文本测试中,搜狗输入法没有因为我一次说了一分半而卡壳,或者出现识别速度变慢、耗时变长的情况。我这边说完,AI润色个两三秒,就能输出一整段完整的文字,这一点我觉得做的还是非常不错的。

至于千问输入法,受限于输入模式,只要我一直在说,千问输入法一定会等我把整段话都说完之后再进行处理。和短文测试一样,千问的识别准确度是没有任何问题的,但是它的识别、思考时间较之前短文测试明显变长。我说完之后,它差不多要等个5-6秒才能把这一段文字一次性输出。

边写边转录的豆包输入法,在长文本输入时效性上有着更好的表现,即使我连说一分钟,它也不会有过载的现象,同样能做到我这边说完,它文字马上就出现。

但Typeless的表现就有些意外了(以下语料为雷科技关于磁吸镜头报道的文章):

「当然了,任何模块化方案最终都绕不开生态问题,磁吸镜头自然也不例外。在雷科技看来,磁吸镜头能否成为长期存在的产品形态,并不只取决于技术是否成熟,而取决于品牌是否愿意围绕它构建一套可持续演进的配件体系。在理想状态下,这种体系可能包括不同焦段、不同用途的镜头模组,甚至引入第三方厂商参与。

但从过往经验来看,手机厂商在影像接口和系统控制权上往往持谨慎态度。因此雷科技认为:

在相当长一段时间内,磁吸镜头仍会以厂商主导、生态有限的形式存在。

它将更多地承担探索和验证的角色,而不是迅速演化为通用标准。

但即便如此,它的行业意义依旧存在。在一个已经被多摄算法和AI卷至极限的影像市场里,磁吸镜头至少提供了一种新的解题思路。当机身形态和模组堆叠逐渐触及极限时,影像能力的突破也许不在机身之内。」

虽然采用了和千问一样的先录音再处理的方式,但是Typeless并没有因为我连续说了1 分半钟而延长它的思考识别时间。我说完之后等了不到2 秒钟,它就把整段文字输出出来了,效率上是比千问要高一点点的。

但Typeless犯了自作主张的问题。我只是说了一段话,它就自顾自地帮我把文字分成了带有有序列表的格式,非常主动地做了整理,这一点我觉得有些越俎代庖。

中英文混说和方言才是终极挑战

很显然,作为一个AI时代的输入法,只会中文是远远不够的。中英混合输入,甚至是方言输入,才是考验语音输入法的难点。这里雷科技也用前段时间报道Google I/O 2026的文章开头,对四款输入法进行了一个简单的测试。

首先是搜狗(以下语料为雷科技关于Google I/O报道的文章):

千呼万唤始出来,北京时间间2026年5月20日凌晨,Google I/O 2026正式开幕。因Show活动17的新功能发布,AI成为本届大会的核心议题。与其他AI企业不同,Google同时拥有YouTube、Google网页搜索、Android等多类互联网生态入口,因此如何以AI技术为上述生态赋能,成为本次大会的重点议题。

尽管在功能上,搜狗并没有对中英混输进行一个专门的分类,只有普通话和方言这两个选项。但从实际效果来看,即使我只选择普通话,搜狗也是有一定的英文输入能力的,只是它的识别效率可能不是那么的准确,比如「The Android Show」就没有准确识别出来(以下语料为雷科技关于Google I/O报道的文章):

千呼万唤始出来,北京时间2026年5月20日凌晨,Google I/O 2026终于开幕。因为Google提前用Android Show分流了Android 17的新功能,AI终于成了Google I/O 2026的主角。但不同于其他AI企业,Google同时掌握Gemini、YouTube、Google网页搜索、Android等多个不同的互联网生态入口,因此如何用AI为这些生态服务赋能也成了此次Google I/O的重点。

虽然识别用时比较长,但是从结果来看,千问语音输入法显然有着更好的中英文输入的支持,对于一些常用的英文单词,也不至于说因为错误识别而导致整句垮掉的情况。

我们再来看看豆包的表现(以下语料为雷科技关于Google I/O报道的文章):

千呼万唤始出来,北京时间2026年5月20日凌晨,Google I/O 2026终于开幕。因为Google提前用The Android Show分流了Android 17的新功能,AI终于成了Google I/O 2026的主角。但不同于其他AI企业,Google同时掌握Gemini、YouTube、Google网页搜索、Android等多个不同的互联网生态入口。因此,如何用AI为这些生态服务赋能,也成了此次Google I/O的重点。

豆包的语音输入法采用的是实时转写的工作模式,第一次识别的时候,豆包错误地把The Android Show识别成了The Enjoy Show。但在听到后面我说其他内容时,豆包输入法会反过来检查前面的内容,并自动把这个错误识别的地方给修正掉。

最后我们来看一看Typeless(以下语料为雷科技关于Google I/O报道的文章):

千呼万唤始出来,北京时间2026年5月20日凌晨,Google I/O 2026终于开幕。因为Google提前用The Android Show分流了Android 17的新功能,AI终于成了Google I/O 2026的主角。但不同于其他AI企业,Google同时掌握Gemini、YouTube、Google网页搜索、Android等多个不同的互联网生态入口。因此,如何用AI为这些生态服务赋能,也成了此次Google I/O的重点。

来自海外的Typeless对中英文混输,甚至是英文单词的准确度自然是毋庸置疑。值得一提的是,即使面对中英混说的情况,Typeless的识别时间也没有明显变长。

方言测试方面,雷科技选择了在海外使用较多的粤语进行测试。

搜狗输入法(以下语料为身为广东人的小雷的语音输入):

语其中一个最大的特色在于其拥有句末助词。到底粤语有哪些句末助词?它们又可以怎样写出来呢。

因为搜狗语音输入法有一个实时的预览窗,所以在播放录音的时候,雷科技发现搜狗输入法一开始其实犯了不少错误。但好在它的AI规整能力能把前面的一些地方纠错掉。从结果来看,它对粤语的识别也还可以,只犯了一个错误:把句首的「粤音」识别成「语」。

我们再来看看千问的表现(以下语料为身为广东人的小雷的语音输入):

粤语其中一个最大的特色在于其拥有丰富的句末助词。到底粤语有哪些句末助词?它们又可以怎样写出来呢?

识别效果上,千问的表现显然比搜狗要完整,至少没有漏字的情况,但也同样把「音」识别成了「语」(以下语料为身为广东人的小雷的语音输入):

粤音其中一个最大嘅特色在于其拥有丰富嘅句末助词。到底粤语有边一啲句末助词?佢哋又可以点样写出嚟咧?

不得不说,豆包语音输入法对于粤语的支持是比较完整的。它不仅能分辨出「粤音」「粤语」的区别,同时输出的文本中也保留了粤语的书写习惯,不至于把粤语翻译成普通话。

最后我们再来看看Typeless(以下语料为身为广东人的小雷的语音输入):

粤音其中一个最大的特色,在于其拥有丰富的句末助词。到底粤语有哪些句末助词,它们又可以怎样写出来呢?

从识别效果上看,Typeless和豆包都能准确的抓到粤语的其中一些关键词,至少没有错误识别的情况。至于把粤语的原始输入翻译成普通话书面语的状况,雷科技认为这个跟Typeless的工作方式有关。

在设置界面,我们能找到Typeless选择输入语言分支的状况,我们需要选择按照简体中文还是繁体中文来输出。也应该是这个设计导致了最终输出的文字并非粤语。

总结:各有千秋,

豆包和千问综合表现最佳

看到这里,我们不妨先总结一下四款语音输入法的综合表现。

在语音输入方面,豆包输入法的表现显然是四款输入法里面表现最好最稳定的一个。无论是交互界面,还是识别的速度,甚至是长文本、中英文混说,以及对方言支持,豆包输入法都是做的最好的一个。

但从另一个角度讲,豆包输入法也有自己的短板:它能且只能用于输入这一个单一场景,并没有像千问那样丰富的AI能力。当然了,豆包也有专门的macOS客户端,如果你确实需要用豆包进行一些类似语料规整或者表达优化的处理,那用专门的豆包客户端可能更合适一点。

作为全能AI的代表,雷科技认为 千问和Typeless的表现不相上下。千问的语音输入能力显然是最完整的,对于中文的处理和优化也都非常到位。如果你有AI语音输入和AI Agent的使用场景,那千问显然最适合你。

在雷科技体验的这段时间里,千问macOS语音输入的功能已经迎来了不止一次更新,识别速度较之前也有所提升。但就整体表现来说,千问语音输入法这个先说话再识别再输出的工作模式,在时效性上确实不占优。

至于Typeless,它的功能虽然没有千问那么完整,但同样对输入、翻译、语音规整这三大主要功能进行了一定的集成。在能力上,雷科技认为它处于豆包跟千问的中间。如果你觉得豆包输入法的功能太少,而千问捆绑整个AI Agent又过于臃肿,那Typeless其实是一个不错的选择。

只不过,Typeless也有自己的问题。首先,这是一个免费试用、收费使用的软件。如果你不付费的话,每周只能输入8000个词,这对于文字工作者来说是绝对不够用的。在国内还有更优秀的免费输入法的情况下,选择一个收费的AI输入法,我觉得有些得不偿失。

最后我们来谈谈搜狗输入法,其实搜狗输入法的模式跟豆包输入法有点类似,它同样是在一个输入法里面集成了AI功能,只不过搜狗是把以前那个语音输入组件底层切换到了腾讯元宝大模型。换句话说,如果你本身就使用搜狗输入法,那选择「搜狗」的学习成本显然更低,体验也是会是相对更好。

总的来说,如果你之前没用过AI语音输入法,那雷科技更建议你试试豆包输入法和千问输入法。

从语音输入的发展来看,虽然说传统的键盘输入不会「明天就消失」,由微软、苹果建立的「生态墙」也尚未开放。但从最近几年输入的发展速度来看,更高效、更好用的语音输入已经用实力证明了自己。在这个属于大模型的时代,坚持手工输入的人依然值得尊敬,但会用AI的人,已经体会到了「言出法随」的奥妙。

注:文/雷科技AI硬件组,文章来源:雷科技(公众号ID:leitech),本文为作者独立观点,不代表亿邦动力立场。

文章来源:雷科技

广告
微信
朋友圈

这么好看,分享一下?

朋友圈 分享

APP内打开

+1
+1
微信好友 朋友圈 新浪微博 QQ空间
关闭
收藏成功
发送
/140 0