技术的进步通常都是较为缓慢的,这种量的积累常常不被人们关注,因为单独一项成就不足以打破现有认知和惯性,但当这些量积累到一定程度后,将所需技术凑齐封装后,就会瞬间引爆市场。这就是技术人眼中的小龙虾。
大模型的智能程度由:数据、算法、训练等相关决定。
从数据处理视角看懂机器学习的过程:
• 数据的收集和挑选(当然,如果数据本身是完整的,则不需要挑选)。
• 数据的预处理(包括提高信噪比)。
• 数据的变换(变成计算机能够处理的形式)。
• 数据挖掘和机器学习,获得结论。
• 对结论的解释和评估。
谷歌是一家非常注重数据的企业,它的很多产品策略都是先收集数据,再开发产品,而不是产品上线后,再去想办法改进数据收集。谷歌为了推出它基于手机的语音识别系统谷歌语音(Google Voice),需要大量的语音数据。在过去,各家语音识别公司和实验室都是找人录入数据,比如美国标准的电话语音库Switchboard就是这么构造的。谷歌的方法则不同,它为了收集数据,先推出了一个类似玩具的电话语音识别系统Google-411(识别率相比后来真正的谷歌语音是非常低的),很多人出于实验和玩儿的目的打这个电话,这样就在无意中为谷歌提供了大量的电话录音。在此基础之上,谷歌后来的语音识别产品做得很成功。
这本书,对于你从大户数据视角去理解AI的发展有很大的帮助。
提交反馈
图文智能时代:大数据与智能革命重新定义未来