MySQL中的随机抽取的实现

更新时间：2023年03月20日 10:59:55 作者：XHHP

本文主要介绍了MySQL中的随机抽取的实现，文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值，需要的朋友们下面随着小编来一起学习学习吧

1. 引言

现在有一个需求是从一个单词表中每次随机选取三个单词。

这个表的建表语句和如下所示：

mysql> Create table 'words'(
    'id' int(11) not null auto_increment;
    'word' varchar(64) default null;
    primary key ('id')
) ENGINE=InnoDB;

然后我们向其中插入10000行数据。接下来我们看看如何从中随机选择3个单词。

2. 内存临时表

首先，我们通常会想到用order by rand()来实现这个逻辑：

mysql> select word from words order by rand() limit 3;

虽然这句话很简单，但是执行流程则比较复杂。我们使用explain来看看语句的执行情况：

Extra字段中Using temporary表示需要使用临时表，Using filesort表示需要进行排序。也就是需要进行排序操作。

对于InnoDB表来说，执行全字段排序能够减少对于磁盘的访问，所以会被优先选择。

而对于内存表来说，回表过程只是简单地根据数据行的位置，直接访问内存得到数据，根本不会导致多访问磁盘。所以这时MySQL会优选选择rowid排序。

我们接下来再来梳理下这条语句的执行流程：

创建一个临时表，这个表使用memory引擎，表里有两个字段，第一个字段是double类型，记为R，第二个字段是varchar(64)类型，记为W。并且这个表没有索引。
从words表中，按主键顺序取出所有的word。对于每个word，调用rand()函数随机生成一个大于0小于1的随机小数，并把这个随机小数和word分别存入临时表的R和W字段中。
接下来就是按照字段R进行排序
初始化sort_buffer。sort_buffer有两个字段，一个是double类型，另一个是整型。
从内存临时表中一行行取出R值和位置信息，分别存入sort_buffer的两个字段里。
sort_buffer按照R值进行排序
排序完成后，取出前三个结果的位置信息，到内存临时表中取出相应的word，返回给客户端。

流程示意图如下所示：

上面讲的位置信息，其实就是行所在的位置，也就是我们之前说的rowid。

对于InnoDB引擎来说，对于有没有主键表来说有两种处理方式：

对于有主键的InnoDB表来说，这个rowid就是主键id
对于没有主键的InnoDB表来说，这个rowid是由系统生成的，用来标识不同行。

因此，order by randn()使用了内存临时表，内存临时表的排序方法用的是rowid排序方法。

3. 磁盘临时表

不是所有的临时表都是内存临时表。tmp_table_size这个配置限制了内存临时表的大小，如果超过了这个大小，就会使用磁盘临时表。InnoDB引擎就是默认使用磁盘临时表。

4. 优先队列排序算法

在MySQL5.6之后，引入了优先队列排序算法，这种算法是不需要使用临时文件的。而原本的归并排序算法则是需要使用临时文件。

因为当你使用归并算法的时候，其实你只需要得到前3，但是你是用完归并排序，那已经整体有序了，造成了资源的浪费。

而优先队列排序算法则可以只取到前三，执行流程如下：

对于这10000个准备排序的(R,rowid)，先取前三行，构造成一个堆，并且将最大的值放在堆顶；
取下一行（R’,rowid’），跟当前堆里面最大的R比较，如果R’小于R，则把(R,rowid)从堆中去掉，换成（R’,rowid’）。
不断重复上面的过程。

流程如下图所示：

但是当limit的数比较大时，维护堆比较困难，所以又会使用归并排序算法。

来源：自己整理的MySQL实战45讲笔记

到此这篇关于MySQL中的随机抽取的实现的文章就介绍到这了,更多相关MySQL 随机抽取内容请搜索脚本之家以前的文章或继续浏览下面的相关文章希望大家以后多多支持脚本之家！

您可能感兴趣的文章:

mysql 8.0.12 winx64下载安装教程
这篇文章主要为大家详细介绍了mysql 8.0.12 winx64下载安装教程，具有一定的参考价值，感兴趣的小伙伴们可以参考一下
2018-09-09
MySQL中数据库优化的常见sql语句总结
这篇文章主要为大家总结了一些MySQL中数据库优化的常见sql语句，文中的示例代码讲解详细，对我们学习MySQL有一定帮助，需要的可以参考一下
2022-08-08
mysql如何分别按年/月/日/周分组统计数据详解
我们在用Mysql抽取数据时候,经常需要按照天、周、月等不同的粒度对数据进行分组统计,下面这篇文章主要给大家介绍了关于mysql如何分别按年/月/日/周分组统计数据的相关资料,需要的朋友可以参考下
2022-12-12
MySQL插入数据insert ignore语法重复数据自动忽略
这篇文章主要给大家介绍了关于MySQL插入数据insert ignore语法重复数据自动忽略的相关资料,最近工作中使用到了insert ignore into语法,感觉这个语法还是挺有用的,就记录下来做个总结,需要的朋友可以参考下
2023-08-08
Win10 64位使用压缩包安装最新MySQL8.0.18的教程(图文详解)
本文通过图文并茂的形式给大家介绍了WIN10 64位使用压缩包安装最新MySQL8.0.18的教程，本文给大家介绍的非常详细，具有一定的参考借鉴价值,需要的朋友可以参考下
2019-12-12
SELECT * 效率低原理解析
这篇文章主要为大家介绍了SELECT * 效率低原理解析，有需要的朋友可以借鉴参考下，希望能够有所帮助，祝大家多多进步，早日升职加薪
2023-02-02
使用JS+HTML/CSS实现虚拟滚动和分页加载效果
虚拟滚动和分页加载是一种优化大型数据集的常见技术,用于在Web应用程序中提高性能和用户体验,在本文中,我将演示如何使用JavaScript和HTML/CSS来实现虚拟滚动和分页加载,同时提供示例代码和详细解释,需要的朋友可以参考下
2023-10-10
MySQL七大JOIN的具体使用
本文主要介绍了MySQL七大JOIN的具体使用，文中通过示例代码介绍的非常详细，具有一定的参考价值，感兴趣的小伙伴们可以参考一下
2022-02-02
sql与各个nosql数据库使用场景的讲解
今天小编就为大家分享一篇关于sql与各个nosql数据库使用场景的讲解，小编觉得内容挺不错的，现在分享给大家，具有很好的参考价值，需要的朋友一起跟随小编来看看吧
2019-03-03
详解mysql 获取某个时间段每一天、每一个小时的统计数据
这篇文章主要介绍了mysql 获取某个时间段每一天、每一个小时的统计数据，文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值，需要的朋友们下面随着小编来一起学习学习吧
2019-04-04