在 mysql 中, by用于将具有指定列中相同值的行分组在一起,允许对数据进行分类和聚合,即按照指定的字段或者表达式进行分组。
我们现在有一个简单的表student,内容如下表1所示:
对于上面这个表,我们要求查询每个班几个人?
答案是:select class,count(class) from student group by class;
有很多初学者在学习group by时,不明白为什么不是select * from student group by class,为什么一定不能是*,而是某一个列或者某个列的聚合函数,group by 应该怎么去理解呢?
上表如果执行 select name from class;语句,应该很好理解,展示如下表2内容:
为了能够更好的理解“group by”多个列“和”聚合函数“的应用,我们在思考的过程中,由表1到表2的过程中,增加一个虚构的中间表:虚拟表3。下面说说如何思考上面sql语句执行情况:
1.from student:该句执行后,应该结果和表1一样,就是原来的student表。
2.from student group by class:该句执行后,生成过程是这样的:group by class,那么找class那一列,具有相同class值的行,合并成一行,我们想象生成了虚拟表3,如下所图所示。如对于class值为”一班” 的,那么id为1,3,4的三行合并成1行,即所有的id值,name值和class值写到一行里面,同样,对于class值为”二班”的,那么id为2,3的二行合并成一行,所有的id值,name值和class值写到一行里面。
3.接下来就要针对虚拟表3执行select语句了:
(1)如果执行select *的话,那么返回的结果应该是虚拟表3,可是id和name中有的单元格里面的内容是多个值,而关系数据库就是基于关系的,一个单元格中是不允许有多个值的,所以执行select * 语句就报错了。
(2)我们再看class列,每个单元格只有一个数据,所以我们select class的话,就没有问题了。为什么class列每个单元格只有一个值呢?因为我们就是用class列来group by的。
(3)那么对于id和name里面的单元格有多个数据的情况怎么办呢?答案就是使用聚合函数,聚合函数就用来输入多个数据,输出一个数据的。如count(class)等聚合函数,而每个聚合函数的输入就是每一个多数据的单元格。
4、所以,我们执行select class, count(class) from student group by class;,那么count(class)就对虚拟表3的class列的每个单元格进行count操作,最后执行结果如下:
所以,通过上面的分析,如果对多个字段进行分组,原理也是一样的。
37000.com威尼斯 copyright © 2013-2021 河南云和数据信息技术有限公司 isp经营许可证:豫b-20160281