77百科网
当前位置: 首页 生活百科

数据库高级教程入门基础知识(写给新人的数据库入门指南)

时间:2023-08-01 作者: 小编 阅读量: 4 栏目名: 生活百科

此文是《10周入门数据分析》系列的第5篇。上周更新了两篇Excel学习,有读者反映写得不够实操。客观原因是绝大部分数据分析岗都有SQL技能的要求。数据库顾名思义就是数据的集合,是由一张张数据表组成的。下载该工具后,点击运行,这个程序就能够联网自动为你安装MySQL,并自动进行配置。在安装过程中,需要你设置密码,自己设置一个登陆密码,并记住,下次登陆MySQL时,需要这个密码。

此文是《10周入门数据分析》系列的第5篇。

想了解学习路线,可以先行阅读“10周计划”

公中号上已更新到第11篇,详情可见文末。


上周更新了两篇Excel学习,有读者反映写得不够实操。这里解释下,文字真的很难将每一步细化,不然真的要出一本书。文章更多是一个引路,告诉大家为什么要学这个,主要学什么,怎么学?深入的操作,还需大家业余加餐啊,已经尽量给大家留了材料了。

也有人提议,出个视频,不错!很赞!明年计划下。即使没有时间,我也会推荐一些我认为OK的视频让大家学习。

年底了,近几个晚上都在苦熬年终报告,各位写好了么?

好了,回到正文,本篇讲数据库知识:

经常有刚从事数据分析的职场萌新,问我做数据分析工作要学些什么,应该怎样规划学习路径。我会告诉他:如果你Excel还用的不溜的话,就先学学Excel,当你用Excel处理和分析一些小数据集没有问题的时候(具体表现就是:常用函数公式信手拈来,数据透视表,筛选,排序,图表绘制操作熟练),你就去学习SQL语言,然后用BI去分析去熟悉业务。然后到了一定阶段,你可以上手R或者Python。后面如果你能更进一步,可以去了解一些Spark等大数据框架。

为什么要学习Excel?

首先Excel是我们最常用的数据分析和处理工具,Excel的功能非常丰富,基本可以涵盖我们在之后在其它软件(SQL、BI、Python、R)中要学到的那些功能。

有的人可能会问,既然Excel这么强大,为什么还要学其它的工具?这是因为Excel是通过菜单的形式来进行操作的,很难实现自动化和功能复用,当然你也可以通过VBA来实现,用VBA也就是编程了,不过因为VBA这种语言学会了基本只能在office软件中使用,学习的投入成本和产出收益不成比例,不推荐学习,这是客观原因之一;另外就是Excel在处理比较大的数据集的时候,性能很差,并且经常崩溃。(虽然Excel2013及以上版本宣称可以容纳100 万条记录,但几万条数据就开始卡顿了)。

为什么Excel学完要学SQL?

客观原因是绝大部分数据分析岗都有SQL技能的要求。企业里面为了保证数据的安全性和管理的方便,数据都是统一存放在数据库中,从数据库中提取和查询数据需要使用SQL语言,甚至有的公司就是用SQL语言来做数据分析。

另外一个原因就是即使你先学了其它的工具,比如R,Python,甚至Spark等大数据框架,你会发现最后你还是得学习SQL。如果你先学习SQL,那么很多概念你都能在学习R,Python,Spark等更加复杂的工具之前弄清楚。对于后面的学习会有帮助。这就好比建房子,都是先打地基,然后一层一层的盖。

SQL语言的学习排在Excel之后,其它工具之前,还有一个很重要的原因就是,SQL可以在一定程度上帮Excel解决大数据集的问题,同时架起一个通往其它工具的桥梁。

关于数据库和SQL的学习,也是分为两篇,第一篇讲数据库以及表的概念。第二篇是SQL语句的掌握和数据库的操作。

一、数据库基础知识

先谈一下我对数据库的理解。数据库顾名思义就是数据的集合,是由一张张数据表组成的。

放在物理实体上,是一堆写在磁盘上的文件,文件中有数据。这些最基础的数据组成了表(table),我们把它想象成一张Excel的sheet,如下图:

每一张表都有一个唯一标识,即主键,也就是ID。ID是数据库中重要的概念,叫做唯一标识符/主键,用来表示数据的唯一性。就相当于我们的身份证,是唯一的,有了身份证,就知道数据在哪了。

ID通常没有业务含义,就是一种唯一标识,每张表只能有一个主键,且主键通常是整数,主键一旦设立,值通常不允许修改。

数据库是表的集合。一个数据库中可以放多张表,我们给每张表命名,表与表之间能互相联系。联系就是数据能够对应匹配,正式名称叫联接,对应的操作叫做Join,我们想象成Excel中的vlookup。

比如上面两张图,左图是学生信息表,右图是老师信息表。左图的主键是学生ID,右图的主键是老师ID。细心的读者可能发现右图还有一个学生ID,这里的学生ID是专门用来联接用户表的,它并不是主键。只不过两张表通过学生ID这个唯一信息来关联。

但两张表关联也并不是信息能一一对应的,也会存在空缺的时候,比如:

那两表建立连接就会变成:

了解上面的概念,你就知道什么叫关系型数据库。简单说,它是由多张能互相联接的二维行列表格组成的数据库。在数据准备时,我们通常要建立表关联来分析。

关系型数据库是基于关系代数模型发展而来,常用的关系型数据库有SQL Server、mysql、Oracle、DB2等,这个视企业使用为准,我们后续学习都以MySQL为主。

各关系型数据库(不感兴趣可跳过):

DB2: 关系型数据库, 适用于大型的分布式应用系统, 确实是非常非常好的数据库, 无论稳定性, 安全性, 恢复性等等都无可挑剔, 而且从小规模到大规模的应用都非常适合。但是使用起来觉得非常繁琐, 安装的时候要求颇多, 很多软件都可能和DB2产生冲突, 因为一般DB2都是安装在小型机或者服务器上的, 所以在PC上安装很费事儿。新建一个库需要设置很多东西, 分配各种各样的存储空间。

Oracle: 是目前市场占有率最大的数据库, 我在学习SSH的时候用的就是Oracle, 安装起来很繁琐, 而且居然程序文件有3G之多... 用起来非常方便, 对于我这样的初学者, 有很简单的配置, 对于要求很高的企业级应用, 也有很复杂的配置和管理方法, 有很强大的数据字典, 可以说是最实用的数据库了, 但是查了一下, 价格不菲...

MS SQL: 当初用的是2000和2005版, 这两个版本差了很多。2000的数据库做的不错, 程序很小, 操作简单, 功能较全, 算是各方面都很中庸的数据库吧, 是中型数据库, 我的毕业设计就是用MS SQL 2000做的。2005中加入了很多功能, 复杂多了, 有大型数据库的风范了, 而且价格也变高了, 个人觉得除非用的是Window Server 系统或者针对Microsoft产品, 否则不如用Oracle好。

MySQL: MySQL是一个很好的关系型数据库, 免费, 而且功能很全, 程序又小, 安装简单, 现在很多网站都用MYSQL, 在字段约束上做的差了点儿, 其他的都不错, 和MS SQL 用着差不多。

Access: 典型的桌面数据库, 觉得做个单机系统, 比如记账, 记事儿什么的还成, 在局域网里跑个小系统都够呛, 数据源连接很简单, 因为是Office的数据库, 所以Windows自带数据源。

更多关于数据库的知识,看一本《数据库系统概论》就够了。

二、尝试使用MySQL数据库

如果还没有接触过数据库或者说SQL,推荐大家下载并安装MySQL数据进行尝试,MySQL数据库的下载安装比较简单,安装完成就可以使用。

可以访问MySQL官网进行下载,网址如下(这里给出的是Windows版下载地址):

「链接」

下载MySQL时,需要进行免费注册,注册页面是英文的。下载该工具后,点击运行,这个程序就能够联网自动为你安装MySQL,并自动进行配置。在安装过程中,需要你设置密码,自己设置一个登陆密码,并记住,下次登陆MySQL时,需要这个密码。

解压之后没有my.ini文件(我的端口设置的3308),截图中是我增加的。

管理员命令行:

在MySQL安装目录的 bin 目录下执行命令:

mysqld --initialize --console

得到如下结果:

看到有个警告,查了一下mysql建议使用utf8mb4

修改my.ini文件

警告没有了,上面打印了默认密码:nj>uUJkpH4/I

然后,安装服务:

mysqld --install MySQL8.0

因为这是电脑上第二个mysql 所以服务名改成了 MySQL8.0

启动服务:

net start MySQL8.0

修改初始密码

登录mysql之后执行:

ALTER USER 'root'@'localhost' IDENTIFIED WITH mysql_native_password BY '123456';

将MySQL和Excel或者其它数据分析工具连接起来

默认安装的情况下,有一个插件允许MySQL数据库和Excel相连接,试想一下,我们在MySQL数据库中通过SQL语言进行大量数据的处理和计算,将计算结果存放在特定的数据表中,再通过Excel连接上MySQL数据库,将数据读取到Excel中,用Excel进行分析并绘制图表,免去了将数据从数据库导出再导入Excel的麻烦,是不是就可以提高效率了呢?

后面会分享一篇通过ODBC驱动程序连接一些报表\BI工具来做分析的操作。

关于MySQL的学习推荐书籍《MySQL必知必会》。

关于学习计划

近期,我的公众号【数据分析不是个事儿】在策划《10周入门数据分析》系列文章,教课书式手把手教大家入门数据分析。

本文是系列中的第5篇,公中号上已更新到第11篇。

可以戳下“了解更多”前往关注。

    推荐阅读
  • 蚕砂枕头的功效与作用及禁忌(蚕砂枕头的相关介绍)

    蚕砂枕头的功效与作用及禁忌?接下来我们就一起去研究一下吧!蚕砂枕头的功效与作用及禁忌功效:促进人体调节功能发挥,促进肌胳舒通,气血流畅的功效;具有祛风除湿、活血散风、提神醒目、止痒去痛的功效;具有和胃化浊、明目降压、去风降湿的功效;具有清凉降火、清热解毒、增强记忆、改善睡眠的功效。

  • 医用酒精怎么使用(医用酒精的用法)

    以下内容希望对你有帮助!医用酒精怎么使用医用酒精的常见使用方法有手部消毒,将消毒剂均匀喷洒于手部或涂擦于手部表面2遍,作用3分钟;外科手消毒擦拭2遍,作用3分钟。体温表消毒,将体温表完全浸泡于消毒剂中,作用30分钟。使用医用酒精时要注意,酒精作为外用消毒剂不得口服,要放置于儿童不易触及处。酒精易燃,应远离火源,酒精过敏者也要慎用。

  • 让孩子看动画片都看哪些(你还在给孩子看动画片)

    推荐8部适合3-5岁孩子的纪录片,记得保护眼睛,不要超过半小时哦。设计专为4岁以上儿童拍摄,是对孩子进行思维认知和美育启蒙的专题片,每集15分钟。其突破性的创意曾引起设计和教育各界的关注和热议,治愈的停格动画、魔性的排版之歌等,更让世界各地孩子都喜爱有加。小朋友能在潜移默化中懂得爱与责任。

  • 金玉其外败絮其中的意思(金玉其外败絮其中出自哪里呢)

    我们一起去了解并探讨一下这个问题吧!金玉其外败絮其中的意思金玉其外,败絮其中是一个汉语成语,读音是jīnyùqíwài,bàixùqízhōng,意思是外表像金玉般华美,内里却尽是破棉絮。形容外表美好而内质破败。明·刘基《卖柑者言》:观其坐高堂,骑大马,醉醇醲而饫肥鲜者,孰不巍巍乎可畏,赫赫乎可象也;又何往而不金玉其外,败絮其中也哉。

  • 关于春节来历的故事(关于春节来历的故事欣赏)

    关于春节来历的故事我国的传统节日可真多啊!有春节,元宵节,中秋节等等等等。从前,有一只叫“年”的怪兽,它在每年的最后跑来吃人。有个人知道年怕红红的和声响大的东西。春节习俗有很多。除了习俗,最令人垂涎三尺的非美食莫属了。年糕年糕年年高升,汤圆汤圆团团圆圆,饺子饺子吉祥如意。光看起来美,闻起来香,吃起来甜就能说明一切。有年的故事,有好吃的汤圆,还有美丽的爆竹。春节,你给我们了多少快乐,我喜欢你!

  • 梦到人未去世买了棺材(梦到棺材让我好运不断)

    凌晨被一场梦惊醒,再也无法入睡。回到刚才听到那个声音的地方,居然听到一阵嘲笑。他告诉我他要做二次加工,这样来说,他现在也是棺材老板了。下楼打牌,好运不断。是大富大贵的象征,如果你梦见自己死了,棺材之类的那更加的是大福大贵,富贵溶化。想好的,别吓自己梦见棺材,预兆要发财,有财运。隐喻着升官发财,在特定的梦境下,梦见棺材预示着好运降临。本文与图均来自网络,侵删,欢迎在评论里分享你梦到的情景,记得关注我

  • 喜迎二十大忠诚保平安(喜迎二十大忠诚保平安)

    了解情况后,户籍民警边安慰女孩,边迅速核查考生相关信息,并向考生说明办理身份证流程后,加急为其补办了身份证并制作了临时身份证。

  • 日本有什么礁岛(冲之鸟礁是礁)

    2009年,11月,日本向联合国大陆架界限委员会申请审议南太平洋大陆架延伸案。扩大日本的海域面积和大陆架。日本划设的本国专属经济区有助于日本争夺这个区域的战略资源。据调查,在其周围的专属经济区开采海底资源,可获得至少1160亿日元的收益。冲之鸟礁扼守东海进出太平洋的主要航道,战略位置非常重要。对日本而言可以扩大作战范围,对美国而言可以与关岛军事基地呼应,交叉控制西太平洋。

  • 小鳗鱼怎么做好吃(小鳗鱼的做法)

    以下内容希望对你有帮助!辅料:油1勺、酱油0.5勺、蚝油0.5勺、料酒1匙、糖1勺、盐2匙、味精0.2匙。海鳗的内脏清除干净清洗后沥干水份。锅中倒入油加热,放入花椒和八角炸香再放入葱姜蒜爆香。放入料酒、酱油、蚝油、糖。所有的调味料炒匀入味。添加适量清水放入海鳗。大火炖起来大约10分钟左右,放入盐继续炖。汤汁炖至不多时,放入味精提鲜出锅。装入容器中撒上香菜和红辣椒即可。

  • 十一月你好的说说(十一月你好的说说精选)

    十一月你好的说说每件事,无论好坏,都是礼物。水,最容易消失在水中;人,也最容易泯灭在人海。人生只有走出来的美丽,没有等出来的辉煌。目标和信念给人以持久的动力,它是人的精神支柱。一个人只有在全力以赴的时候才能发挥最大的潜能。有时候你原谅别人,只是因为你还想让他们出现在你的生活中。