快出数量级的性能是怎样炼成的

叶秋学长 叶秋学长     2023-03-23     133

关键词:

前言:今天学长跟大家讲讲《快出数量级的性能是怎样炼成的》,废话不多说,直接上干货~

我们之前做过一些性能优化的案例,不算很多,还没有失手过。少则提速数倍,多则数十倍,极端情况还有提速上千倍的。提速一个数量级基本上是常态。下面是一些案例材料:

开源 SPL 提速保险公司团保明细单查询 2000+倍

开源 SPL 提升银行自助分析从 5 并发到 100 并发

开源 SPL 提速银行用户画像客群交集计算 200+倍

开源 SPL 优化银行预计算固定查询成实时灵活查询

开源 SPL 将银行手机账户查询的预先关联变成实时关联

开源 SPL 提速银行资金头寸报表 20+ 倍

开源 SPL 提速银行贷款协议跑批 10+ 倍

开源 SPL 优化保险公司跑批优从 2 小时到 17 分钟

开源 SPL 提速银行 POS 机交易报表 30+ 倍

开源 SPL 提速银行贷款跑批任务 150+ 倍

开源 SPL 提速资产负债表 60 倍

这是怎么做到的呢?这些被提速的场景都有一个共同点:原先都是用各种数据库(也有HADOOP/Spark)上的SQL实现的,包括查询用的几百行SQL也有跑批用的几千行存储过程,然后我们改用集算器的SPL重新实现之后就有了这样的效果。集算器SPL有什么神奇之处?是不是能让各种运算跑得更快?有点遗憾,并没有这样的好事。集算器也是一个软件,而且是用Java写的,完成同样运算通常比C/C++写的数据库还要慢一点。那是怎么回事?

根本原因在于我们用SPL实现了不同的算法。软件不能提高硬件的速度,但我们可以设计出更低复杂度的算法,有效地减少计算量,然后速度自然就上去了。一个运算任务本来要做1亿次加法,如果能减到100万次,那自然就能快100倍,即使每次运算都变得稍慢一点,总体性能仍然会提高,这一点也不神奇。只要能实现高性能算法和存储,用什么技术来做并不重要了。用C/C++、Java当然都能做出来。事实上,集算器是用Java写的,用Java直接实现这些算法原则上还会更快一点,用C/C++ 一般还能更快(Java的内存分配消耗时间还是有点多)。不过,虽然用Java和C++能写出比SPL更快的代码,但要长得多(估计会长出50-100倍),这会导致开发工作量过大,这在实际应用时也是要权衡的一个指标。有时候,跑得快和写着简单其实是一回事,就是能高效率地实现高性能算法。集算器的SPL中强化了结构化数据的数据类型,并提供了很多基础的高性能算法。写代码就是组合运用这些算法,当然会方便得多。要说神奇之处,也就是这一点了。

那么,继续SQL就不能做到同样的事吗?是的。SQL设计得过于粗线条,关系代数这个理论基础中缺乏很多数据类型和基础运算,很多高性能算法都无法描述,结果只能使用慢算法。虽然现在很多数据库和大数据平台都在工程上有所优化,但也只能针对简单的场景,情况复杂之后数据库的优化器都会“晕”掉,所以解决不了根本问题。这是个理论上的问题,无法在工程层面解决。SPL基于的理论基础不再是关系代数,而是我们发明的离散数据集。在这个体系下有更多的数据类型和运算,就能写出更多高性能算法了。SPL是离散数据集的一种实现,封装了许多现成的算法。用Java和C++当然也能从头来实现这个代数体系,因而都能写出来高性能代码。而SQL却不可以。

举个简单的例子,我们想在1亿条数据中取出前10名,用SQL写出来是这样的:

select top 10 x,y from T orderby x desc

这个语句中有个order by,严格按它执行就会涉及大排序,而排序非常慢。其实我们可以想出一个不用大排序的算法,但用SQL却无法描述,只能指望数据库优化器了。对于这句SQL描述的简单情况,很多商用数据库确实都能优化,使用不必大排序的算法,性能通常很好。但情况复杂一些,比如在每个分组中取前10名,要用窗口函数和子查询把SQL写成这样:

select*from

(select y,*,row_number() over (partitionby y orderby x desc) rn from T)

where rn<=10

这时候,数据库优化器就会犯晕了,猜不出这句SQL的目的,只能老老实实地执行排序的逻辑(这个语句中还是有order by的字样),结果性能陡降。而SPL不一样,离散数据集中有普遍集合的概念,TopN这种运算被认为是和SUM和COUNT一样的聚合运算,只不过返回值是个集合而已。这时候写出来的取前10名的语句中并没有排序动作:

T.groups(;top(-5;x))

分组后的写法也很简单,都不需要执行大排序:

T.groups(y;top(-5;x))

这里 性能优化技巧:TopN 还有关于这个问题的更详细测试对比。

所以,我们做性能优化时要重写代码,不能继续使用SQL保持兼容。要读懂原来的逻辑重新实现,这个工作量还是很大的,不过能换来数倍数十倍的性能提升,常常还是值得的。另外,存储也非常重要,好算法要有合适的存储机制配合才能生效,所以不能继续把数据继续存在数据库里获得高性能,需要搬出来换种办法组织存放。改变存储后,有可能把原来需要缓存的计算过程变成不需要了,原来要遍历多遍的运算变成只遍历一次甚至不用遍历了,减少硬盘访问量对性能的提升非常有效。

从上面这个原理上看,如果我们不能针对计算目标设计出更好的算法,那就做不到提速了。比如一个很简单的大表求和,用SQL要做1亿次,用SPL也要做1亿次,那就不可能做得更快,一般还会更慢一点(Java赶不上C/C++)。但是,当运算任务足够复杂时,碰到几百上千行的嵌套N层SQL(慢的SQL通常也不会太简单),几乎总能找到足够多可优化的环节,所以我们经历过的案子还没有失手过。结果,在实践上用Java写出来集算器大幅度超越了C/C++写的数据库,这都是算法造就的。我们甚至曾经发过一个广告 慢得受不了的查询跑批寻找用SQL写的慢过程,我们负责提速一个数量级。

换个角度再看这个提速原理:高性能靠的不是代码,而是代数,代码只是个实现手段而已。其中最关键的是掌握和运用这些算法,而不是SPL语法。SPL语法很简单,比Java容易多了,两小时就能基本上手,两三周就能比较熟练了。但算法却没那么简单,需要认真学习反复练习才能掌握。这些案例直接由没有经验的用户自己做常常效果并不好,主要原因也是对算法没有吃透。反过来,而只要掌握了算法,用什么语法就是个相对次要的问题了(当然用SQL这种太粗线条的语言还是不行)。这就像给病人看病,找出病理原因后,能分析出什么成分的药能管用。无论直接购买成药(使用封装过的SPL),还是上山采药(使用Java/C++硬写),都可以治好病,无非就是麻烦程度和支付成本不同。

可能有读者对SPL提供了哪些与SQL不同的高性能算法感兴趣,推荐一下乾学院上的性能优化图书 【性能优化】 前言及目录 和视频课程 《性能优化》课程我们已经把这些算法都整理成有体系的知识了。有些算法是业界首创的,其它教科书和论文中都找不到。跟着这些图书课程学习,掌握这些算法后,就可以自己写到快出数量级的高性能代码。即使自己不写代码,也能理解原理,不会再被很多大数据产品喊什么“万亿秒查”的说法忽悠了。

SPL资料


云原生快出数量级的性能是怎样炼成的?就提升了亿点点(代码片段)

您好,我是码农飞哥,感谢您阅读本文,欢迎一键三连哦。💪🏻1.Python基础专栏,基础知识一网打尽,9.9元买不了吃亏,买不了上当。Python从入门到精通❤️2.Python爬虫专栏,系统性的学习爬虫... 查看详情

云原生快出数量级的性能是怎样炼成的?就提升了亿点点(代码片段)

您好,我是码农飞哥,感谢您阅读本文,欢迎一键三连哦。💪🏻1.Python基础专栏,基础知识一网打尽,9.9元买不了吃亏,买不了上当。Python从入门到精通❤️2.Python爬虫专栏,系统性的学习爬虫... 查看详情

快出数量级的性能是怎样炼成的

前言:今天学长跟大家讲讲《快出数量级的性能是怎样炼成的》,废话不多说,直接上干货~我们之前做过一些性能优化的案例,不算很多,还没有失手过。少则提速数倍,多则数十倍,极端情况还有提... 查看详情

王者荣耀是怎样炼成的

王者荣耀是怎样炼成的(一)《王者荣耀》用什么开发,游戏入门,unity3D介绍王者荣耀是怎样炼成的(二)《王者荣耀》unity安装及使用的小白零基础入门Unity3d引擎原理详细介绍、Unity3D引擎架构设计 查看详情

废鱼是怎样炼成的!

  初中看的那本《钢铁是怎样炼成的》主人公保尔,经过各种各样生活的磨砺,把肉体给练废了,但他精神永存!但是,虽然我和保尔一样把身体练废了,但是我不仅仅练废了身体,还有我的精神!刚毕业入职现在这个单... 查看详情

存储是怎样炼成的?

...解多少,通过上面的一些名词其实可以大致的看到存储是怎样一步步发展的。其中FAT,NTFS和NFS都是支持特定存储协议的存储系统,DAS,SAN,NAS,OSD是一种存储模型。稍微科普一下:FAT,NTFS大家肯定比较熟悉,这个就是单机文件系统,... 查看详情

[转]程序员高手是怎样炼成的?

...朋友在很小的时候就看过奥斯特洛夫斯基同学的《钢铁是怎样炼成的》,偶小时候在农村混,看的最多是各式各样的牛屎以及长得极象牛屎的山头,这些所谓的名著偶直到大学才有机会拜读,但说实话,偶是个俗人,还是更喜欢... 查看详情

高手是怎样炼成的?

大家好,我是小麦。很多大学生、初学者总爱问一个问题:嵌入式这条路怎么走?以下是一位嵌入式高手分享的个人经历,看看钢铁是怎么样炼成的吧,相信会有所帮助。阶段1大一到大三这个阶段我与大多数... 查看详情

高手是怎样炼成的?

大家好,我是小麦。很多大学生、初学者总爱问一个问题:嵌入式这条路怎么走?以下是一位嵌入式高手分享的个人经历,看看钢铁是怎么样炼成的吧,相信会有所帮助。阶段1大一到大三这个阶段我与大多数... 查看详情

最强分布式事务框架怎么炼成的?

hptx是当前性能最强的云原生、无侵入分布式事务解决方案,选择其他内存型存储组件理论上可以得到更高的性能,但综合可靠性和性能,ETCD是目前最好的选择。hptx是当前性能最强的云原生、无侵入分布式事务解决方案,选择其... 查看详情

“软件设计是怎样炼成的?”实战视频课程

适合人群:软件设计师,用户体验设计师,程序员,系统架构师。课程目标:理解什么是优秀的设计;学会从分析需求开始如何逐步做出实用的软件设计;学会架构设计、数据库设计、用户体验设计和详细设计的实战技巧。课程... 查看详情

论spark高手是怎样炼成的

...为它是基于内存的,可以有效减少数据的落地次数。Spark性能超过Hadoop百倍,从多迭代批量处理出发,兼收并蓄数据仓库、流处理和图计算等多种计算范式,是罕见的全能选手。  Spark采用一个统一的技术堆栈解决了云计算大... 查看详情

一个合格的员工或者管理者是怎样炼成的

以下内容均摘抄自姜汝祥的《请给我结果》这本书:任务是一个执行假象,因为我们绝大多数的人在实际工作中,当你以为你是在执行的时候,其实是在完成任务,因为你没有结果!我们要懂得一个基本道理:对结果负责,是对... 查看详情

黑客教父郭盛华,一代传奇是怎样炼成的?

  1990年,郭盛华生于广东肇庆。初中毕业后,前往肇庆市工业贸易学校,就读中专,学习计算机网络技术。郭盛华把握时机,用平时省吃俭用积蓄的创办了自己的一个小网站,成立了自己的黑客帝国。  时光飞逝,岁月如... 查看详情

这些令人仰望的c++大咖,都是怎样炼成的?

C++语言由于在构建系统软件领域的关键作用而被誉为“皇冠上的明珠”。随着C++20国际标准的正式发布,C++进入全新的里程碑。来自Google、微软、腾讯、华为等业界专家纷纷表示,包括C++20在内的... 查看详情

一个简单rpc框架是怎样炼成的(ii)——制定rpc消息

开局篇我们说了,RPC框架的四个核心内容RPC数据的传输。RPC消息协议RPC服务注冊RPC消息处理以下,我们先看一个普通的过程调用classClient(object):def__init__(self):self.remote=None###内部是托付给远程remote对象来获取结果。defsayHello(self):ifs... 查看详情

举三反一,一通百通的“数学脑”是怎样炼成的?

“举三反一”的“一”其实是花样百出的题目背后所隐藏的基本概念和规律,以及正确的思维范式。掌握基础知识和概念,了解正确的思考方法,我们才能学会从题目中看出本质的东西。数学老师总说:“要学会... 查看详情

七牛云视频模板sdk:「剪刀手」是怎样炼成的?

成为作家,在博客兴起后不再是梦想,每个人都可以拥有属于自己的媒体;成为摄影师,门槛儿随着手机像素的提高而降低,用iPhone拍摄的照片也能拿下「荷赛」大奖。那么在短视频浪潮汹涌的当下,成为... 查看详情