讯飞AI学习机亲测:英语跟读评分到底准不准
简单说:讯飞AI学习机对"单个音读没读对"的判断很灵,故意读错必被扣分还能标出错在哪;对"读得自然不自然"偏松,语调僵硬也常给90分以上。同一句连读五遍波动在3分以内,稳定性没问题。建议把它当每天雷打不动的纠音陪练,别当外教平替。
这台讯飞AI学习机在我家已经待了七个月,英语跟读评分是我较真最久的功能。娃读,我也读。家里那个四年级的外甥女小雨,暑假寄住我家,为了分数没少跟我犟。网上夸它的、骂它的都很多,可很少有人把"评分到底准不准"拆开测过。
我干脆自己动手。三组实验:故意读错测灵敏度、同句五遍测波动、真人外教对账测偏差。从7月14日到8月3日,整整21天,记了半个本子的分数。这篇只摆我测出来的东西。
讯飞AI学习机的跟读评分是怎么打出来的
原子答案:它从准确度、流利度、完整度三个维度打分,合成一个百分制总分,读错的词会被标红并定位到具体音素。打分口径参照国际上通用的发音评测框架,类似CEFR那套分级逻辑,不是简单比对你读得像不像原音。
跟读入口在"英语"板块的同步课文和拓展绘本里。读完一句,约2秒出分,然后逐词染色:绿色是读得好,黄色一般,红色就是错。点开红色的词,能看到具体错在哪个音,th咬舌、v咬唇这种提示都写得明明白白。
说实话,这个逐词染色的颗粒度,是我用过几台学习机里最细的。讯飞做智能语音二十多年,评测引擎和它家语音识别同源,这些在科大讯飞官网的技术介绍里都能查到,不算玄学。
艾媒咨询的报告显示,中国智能学习机市场规模已经站上百亿元台阶,各家都在卷口语功能,数据可在艾媒咨询官网核对。市场热闹归热闹。评分准不准,还得自己测。
实验一:故意读错,它抓得住吗
原子答案:抓得住,而且抓得挺细。单音素读错平均扣7到10分,错的词当场标红,提示具体到音素。但整句胡乱读它也只压到61分,下限偏高,这点我不太满意。
测试句是"I have three brothers and two sisters.",我正常读一遍拿96分做基准。然后开始作妖。three读成tree,89分,红色标记直接指到th音,提示"咬舌不到位"。very读成wery,91分,同样被抓。brothers的尾音s我故意吞掉,92分——这个扣得比我预期轻,吞个复数s才扣4分,我原以为会更狠。
然后我把整句含糊着快速糊过去,78分,流利度那栏黄了。最后上大招:拿中文腔瞎念,完全不按英文来。61分。
居然还及格了。挺离谱的。不夸张地说,我盯着那个61分看了半天,怀疑它是不是怕打击孩子才这么打。我猜是流利度和完整度两个维度的权重把总分托住了,音准崩了它也只扣成这样。所以别看孩子拿了个七八十分就觉得读音没问题,那个分数的下限太宽松。
实验二:同一句读五遍,分数会不会飘
原子答案:会飘,但飘得不大。安静房间里同句五连读,最高最低只差3分;开风扇、开电视之后平均掉2到5分,波动也跟着变大。想让分数可信,先保证安静和近距离。
这轮用"Would you like something to drink?"。安静客厅,我连读五遍:93、95、92、96、94。隔一天再读,落在91到95之间。稳。没跑。
环境变量一加,画风就变了。风扇开中档对着吹,五遍降到88到92。电视放动画片段、音量30%,分数88到93之间乱跳,染色也跟着飘,同一句里同一个词,这遍绿下遍黄。偶尔还弹"未检测到语音",重来一遍,耗时约15秒,孩子容易烦。
距离也测了。嘴离麦克风约30厘米读,平均94;挪到一米外,平均89。我的建议就三条:关电视、关风扇、让孩子捧着读。
实验三:拿真人外教的评分对账,差多少
原子答案:十段录音里八段和外教偏差在5分以内,音素层面的判断两边高度一致。分歧集中在语调:机器给"字正腔圆的背书腔"打92,外教只给75,机器在自然度上明显偏松。
我找了自己以前报网课认识的外教Mark,教少儿英语8年,收费按课时算的那种。把小雨和我的10段录音发过去盲听,他按10分制打分,我换算成百分制跟机器对。他听完打分花了约25分钟,还挺认真。
结果挺有意思。八段录音两边分差不超过5分,th、v这些错音他圈的和机器标红的基本是同一批词。机器靠谱。真不是吹。
分歧在两段。小雨有一段每个词都读得标准,但语调平得像报站,机器给了92,Mark只给7.5,原话是"像在背书,没人这么说话"。反过来有一段她读得连贯自然,只吞了一个音,机器扣到83,Mark却给了8.5,说"听得懂,不用扣这么狠"。也就是说,机器对音准是9分水平,对韵律和自然度,顶多6分。评分框架参考的那套国际标准本身没错,错在机器对"自然"的打分太宽松,CEFR的分级思路在维基百科的CEFR词条里有白话解释,你可以对照着看。
插一段不好归类的经历。7月20日晚上,小雨读完一句拿74分,当场就红了眼,说机器针对她。我陪她逐词排查,红色标记停在brothers上,还是那个th,加上她读得太赶。我把速度降下来,一个词一个词过,第二天早上同一句90分。她高兴得跟翻盘了一样。
话说回来,我原本最不看好的就是这类跟读功能,觉得是给家长看的表演型配置。这21天改观了不少,至少在纠音这件事上它确实在干活。至于它值不值那个整机价格,我在科大讯飞AI学习机半年的完整测评里算过账,这里不重复。顺便说一句,我以前默认这类机器都偏智商税,看完三台学习机用下来的判断那篇的对比,立场才松动的。
发音纠正的真实效果:21天记录
原子答案:有效果,但只对"音不准"有效,对"不敢开口"无效。小雨的th音从十次里对两次,变成十次里对八次,跟读平均分从82爬到91。代价是她开始刷分,一句读11遍也要95。
每天15分钟跟读,雷打不动。第1周她平均82分,第3周91分。最明显的是th,从把three读成"斯瑞",到现在能主动咬舌,机器的错误提示每次都推同一个口型示范视频,反复怼。我个人觉得,这比我跟她妈吼一百遍都管用,机器不烦,孩子也不怕丢脸。
但新问题来了。8月2日那晚,她为了一句95分,同一个句子反复读了11遍,耗时约15分钟,眼神已经不对了,纯刷分。我后来立了规矩:每句最多三遍,三遍里最好那次算数。第二天她就不较劲了。所以家长的看护省不掉。
英语只靠跟读也不够。口语要的还是开口量,这篇AI学英语坚持90天的效果记录里写过练习量的影响,跟读只是其中一环。要是拿不准几套工具怎么搭,可以看这篇三款AI英语App的横评,跟读评分只是我挑工具的指标之一。
讯飞AI学习机跟读评分准不准:我的最终判断
原子答案:测"音对不对",我给9分,是我实测过的学习机里最灵的一档;测"读得自然不自然",只值6分,语调僵它照样给高分。结论就一句:当纠音陪练买它不亏,当外教平替你会失望。
| 测试项 | 我怎么测的 | 机器表现 | 我的碎碎念 |
|---|---|---|---|
| 正常朗读 | 10个句子各读1遍 | 93-97分 | 给分不小气 |
| 单音素错读 | th、v、吞尾音各来一遍 | 扣7-10分并标红 | 这块是真灵 |
| 整句中文腔乱念 | 完全不按英文发音 | 61分 | 下限太高了 |
| 同句五连读 | 安静客厅连读5遍 | 极差3分 | 稳,没话说 |
| 风扇+电视噪声 | 中档风扇、电视30%音量 | 平均降4分 | 先关电视吧 |
| 外教盲听对账 | 10段录音双盲打分 | 8段偏差≤5分 | 韵律上偏松 |
一句话收尾:这套评分当"错音探测器"用,准;当"口语老师"用,会误人。孩子读音不标准、家长自己拿不准的,它是利器。孩子已经能对话、缺的是交流感的,另想办法。
常见问题
讯飞AI学习机的跟读评分和外教打分差很多吗?
十段录音对账,八段偏差在5分以内,音准判断基本一致。差就差在语调和自然度,背书腔机器给92,外教只给75。音看机器,味儿还得听真人。
孩子发音基础差,跟读评分能帮他把音纠正过来吗?
能,最见效的就是音素层面。小雨的th音21天从十对二变成十对八,平均分从82到91。前提是控制遍数,不限着读,孩子会陷进刷分里出不来。
家长自己英语不行,能靠这个功能辅导孩子吗?
能顶大半。家长不用会读,只看红色标记和分数趋势就行,机器负责指错。家长要做的就一件事:陪着,别让练习断掉。
分数会不会打击孩子信心?
不太会,因为给分下限偏高,乱读也有61分,孩子不至于被劝退。真正劝退的是反复拿不到高分,把每句限制在三遍以内,取最好那次,心态就稳了。
绕回最初的问题:讯飞AI学习机的英语跟读评分到底准不准——音准维度准得可以当尺子用,自然度维度只能参考。这台机器还有作业诊断等别的功能,我单独测过一AI学习机作业诊断的实测记录,感兴趣接着看。觉得这篇实验有用的话,转给正在纠结要不要买学习机的家长朋友,省得他们只听销售一面之词。