联合索引_随笔_内存溢出

本文预计分为两个部分:

(1)联合索引部分的基础知识

在这个部分，我们温习一下联合索引的基础

(2)联合索引部分的实战题

在这个部分，列举几个我认为算是实战中的代表题，挑出来说说。

正文

基础

讲联合索引，一定要扯最左匹配!放心，我不扯有的没的，几句话懂个大概就行！

最左匹配

所谓最左原则指的就是如果你的 SQL 语句中用到了联合索引中的最左边的索引，那么这条 SQL 语句就可以利用这个联合索引去进行匹配，值得注意的是，当遇到范围查询(>、<、between、like)就会停止匹配。

假设，我们对(a,b)字段建立一个索引，也就是说，你where后条件为

a=1a=1and b =2

是可以匹配索引的。但是要注意的是~你执行

b=2and a =1

也是能匹配到索引的，因为Mysql有优化器会自动调整a,b的顺序与索引顺序一致。

相反的，你执行

b=2

就匹配不到索引了。

而你对(a,b,c,d)建立索引,where后条件为

a =1andb =2andc >3andd =4

那么，a,b,c三个字段能用到索引，而d就匹配不到。因为遇到了范围查询！

最左匹配的原理？

假设，我们对(a,b)字段建立索引，那么入下图所示

如图所示他们是按照a来进行排序，在a相等的情况下，才按b来排序。

因此，我们可以看到a是有序的1，1，2，2，3，3。而b是一种全局无序，局部相对有序状态!

什么意思呢？

从全局来看，b的值为1，2，1，4，1，2，是无序的，因此直接执行b = 2这种查询条件没有办法利用索引。

从局部来看，当a的值确定的时候，b是有序的。例如a = 1时，b值为1，2是有序的状态。当a=2时候，b的值为1,4也是有序状态。

因此，你执行a = 1 and b = 2是a,b字段能用到索引的。而你执行a >1 and b = 2时，a字段能用到索引，b字段用不到索引。因为a的值此时是一个范围，不是固定的，在这个范围内b值不是有序的，因此b字段用不上索引。

综上所示，最左匹配原则，在遇到范围查询的时候，就会停止匹配。

实战

OK，懂上面的基础，我们就可以开始扯了~我举了经典的五大题型，看完基本就懂！

题型一

如果sql为

SELECT*FROMtableWHEREa =1andb =2andc =3

如何建立索引?

如果此题回答为对(a,b,c)建立索引，那都可以回去等通知了。

此题正确答法是，(a,b,c)或者(c,b,a)或者(b,a,c)都可以，重点要的是将区分度高的字段放在前面，区分度低的字段放后面。像性别、状态这种字段区分度就很低，我们一般放后面。

例如假设区分度由大到小为b,a,c。那么我们就对(b,a,c)建立索引。在执行sql的时候，优化器会帮我们调整where后a,b,c的顺序，让我们用上索引。

题型二

如果sql为

SELECT*FROMtableWHEREa >1andb =2

如何建立索引?

如果此题回答为对(a,b)建立索引，那都可以回去等通知了。

此题正确答法是，对(b,a)建立索引。如果你建立的是(a,b)索引，那么只有a字段能用得上索引，毕竟最左匹配原则遇到范围查询就停止匹配。

如果对(b,a)建立索引那么两个字段都能用上，优化器会帮我们调整where后a,b的顺序，让我们用上索引。

题型三

如果sql为

SELECT*FROM`table`WHEREa >1andb =2andc >3

如何建立索引?

此题回答也是不一定，(b,a)或者(b,c)都可以，要结合具体情况具体分析。

拓展一下

SELECT*FROM`table`WHEREa =1andb =2andc >3

怎么建索引？嗯，大家一定都懂了！

题型四

SELECT*FROM`table`WHEREa =1ORDERBYb

如何建立索引？

这还需要想？一看就是对(a,b)建索引，当a = 1的时候，b相对有序，可以避免再次排序！

那么

SELECT*FROM`table`WHEREa >1ORDERBYb

如何建立索引？

对(a)建立索引，因为a的值是一个范围，这个范围内b值是无序的，没有必要对(a,b)建立索引。

拓展一下

SELECT*FROM`table`WHEREa =1ANDb =2ANDc >3ORDERBYc

怎么建索引?

题型五

SELECT*FROM`table`WHEREaIN(1,2,3)andb >1

如何建立索引？

还是对(a，b)建立索引，因为IN在这里可以视为等值引用，不会中止索引匹配，所以还是(a,b)!

拓展一下

SELECT*FROM`table`WHEREa =1ANDbIN(1,2,3)ANDc >3ORDERBYc

如何建立索引？此时c排序是用不到索引的。

众所周知， MySQL的驱动表与被驱动表是优化器自动优化选择的结果（与表连接的前后顺序等无关），我们可以用explain执行计划来知晓：

如上所示，前面一行t1是驱动表，后面一行t2是被驱动表。那么驱动表与被驱动表的选择是否有规律可循呢？下面是百度搜索两个主流的博文对驱动表与被驱动表的阐释：

1. MySQL连接查询驱动表被驱动表以及性能优化 - 阿伟~ - 博客园博文A 主要结论：

2. mysql驱动表与被驱动表及join优化_java小小小黑的博客-CSDN博客_mysql驱动表和被驱动表博文B 其主要结论：

两个帖子的结论是都差不多，而且还给出了例子来佐证。那么网上的结论是否权威？是否有普遍性？是否存在缺陷？

让我们来一起打破砂锅问到底。下面有两张表结构一模一样的表t1,t2：其中t1 100条数据，t2 1000条数据；t1（t2）结构如下：

按照上面博文的结论，left join左边是t2表，应该是驱动表。我们查看下结果：

与博文B 中观点1相违背（同理观点2也违背），与实际不符，但究竟这是为什么呢？

下面发一张MySQL的执行过程（来源于《MySQL实战45讲》中01讲【一条SQL查询语句是如何执行的】）

so die si ne，原来sql执行的过程是这样呀。等等，不对，这跟刚才SQL又有什么关系，上面left join中t2表还是左边的呀。

我们知道MySQL高版本的性能越来越好，它是不断进行优化迭代的。远古的mysql版本可能还需要人工把小表放在前面，大表放在后面等这些需要人工调优的经验早就已经被解决了。也就是说我们写的语句，MySQL为了追求更好的效率，它在执行器执行前已经帮我们优化了。那么实际优化后的sql如何查看呢？用show warning命令：

其中Message就是优化后实际执行的sql语句，格式化后如下：

优化后left join左连接变成了内连接(inner) join。所以用优化后的sql看，表t1是小表所以作为驱动表，与实际结果相符。

left join 竟然优化成了join,太神奇了，但这是为什么呢？原因在于mysql中null与任何值做等值或者不等值比较的时候都是null，即使是select null=null 也是null。这样where 条件t1.a=t2.a查询条件不会包含t2.a为NULL的行，实际效果其实跟join一样，被优化器智能的优化了。

我们直接看执行计划看实际结果吧：

结果显示t2是驱动表，t1是被驱动表。t2是1000条数据按理说是大表应该是被驱动表，与博文A ，博文B 的结论又不一致了。

《MySQL实战45讲》中34讲【到底可不可以使用join】已经讲的很透彻了，很深入了，我就不在这里献丑了。啰嗦几句大概就是驱动表是全表扫描不走索引，所以选被驱动表t1可以走索引，不会全表扫描，减少IO次数，性能高。里面对大表小表的总结，简直是精髓，特意在此再次着重强调：

在决定哪个表做驱动表的时候，应该是两个表按照各自的条件过滤，过滤完成之后，计算参与join的各个字段的总数据量，数据量小的那个表，就是“小表”，应该作为驱动表。

按照上面分析，我们先独立思考下MySQL会选择哪张表作为驱动表呢？

表t1,t2在字段a上都有索引不会全表扫描，其中t1.a=5条件过滤后只有一条，很显然嘛，t1数据量少是小表，肯定是驱动表，错不了，再说了前面的红色粗体已经强调了，不会有错的。

有冇搞错？事实又被打脸了。还记得在开篇我们说过的mysql优化器会对sql语句进行优化的吗？下面我们看下执行计划与优化的sql语句：

格式化后的优化SQL如下：

优化后两表t1,t2都走索引，并且都只有一条结果返回，因此都只会扫描一行，数据量一样，所以谁在前面谁就是驱动表，也就是上面sql中表t2。一切都释然，豁然开通！

回头再仔细想想，高，实在是高！仔细深思之后MySQL优化后的句子真让人猛拍大腿。高明之处在于：

1. 本来join连接是个M*N的嵌套循环，优化后变成了M+N的判断，两表不再嵌套判断了。

2. 优化后，两表没有多大必然联系，只需把两表的结果集拼接即可，互不干扰。如果mysql未来可以多线程查询，岂不十分快哉！

小伙伴们还记得我们在上一章 MySQL索引初探 中编码类型不一致发生隐式转换时有时候走索引，有时候索引又失效的问题吗？下面我们选取有代表性的一条记录来分析：

其中表demo_test总共有640条数据，demo_test_ass有3条数据。显然经过过滤条件t.rid>1完成后demo_test_ass数据量小，应该作为驱动表。虽然test.c_utf8mb4 = t.c2两字段连接中发生了t.c2字段发生隐式转换，但是实际上并不影响被驱动表test上的c_utf8mb4索引。

好了，本章到此结束，让我们一起 总结一下MySQL驱动表与被驱动表的选取原则 ：

หน ง 同等条件，优先选取有索引的表作为被驱动表。 在此介绍一下什么叫同等条件，比如上面的②中的语句。两表没有其他额外的过滤条件，因此选关联字段有索引的t1作为被驱动表。但是如果加了条件(and t1.id=3)，此时t1数据量少，就选取了t2作为被驱动表。

สอง MySQL选择驱动表与被驱动表是基于优化器优化后的，小表是驱动表，大表是被驱动表。 基于优化器优化后开篇的博文A与B 结论成立。

当然这都是我一家之言，并不是官方结论，目前暂未找到官方确切对于驱动表与被驱动表的解释，请大家踊跃拍砖！

欢迎分享，转载请注明来源：内存溢出

原文地址:https://54852.com/zaji/7187376.html

联合索引

发表评论

评论列表（0条）