专题三 数据处理与应用 考点一 常用表格数据的处理 一、数据整理 数据整理的目的 检测和修正错漏的数据、整合数据资源、规整数据格式、提高数据质量。 常见的数据问题 数据缺失、数据重复、数据异常、逻辑错误、格式不一致等。 二、数据计算 常用的数据处理和统计分析工具 Excel、SPSS、SAS、MATLAB 等软件;R、Python、Java 等计算机语言编程。 数据计算(Excel) 以 **=** 开头,分为自定义公式和函数两种方式。 自定义公式:由常数、函数、单元格引用和运算符(+、-、*、/、% 等)组成。 函数:预定义的公式,常用 SUM(求和)、AVERAGE(求平均)、MIN(最小值)、MAX(最大值)。 数据排序 分为单个关键字排序和多个关键字排序。 数据区域必须连续,需选择有 / 无标题行排序。 数据筛选 显示满足条件的数据,隐藏其他数据,范围为表格所有数据。 自动筛选:自定义筛选、10 个最大(小)的值、多条件筛选。 自定义筛选最多设置 2 个条件,“与” 表示同时满足,“或” 表示满足其一即可。 三、数据图表呈现 创建步骤 分析表格数据→选择数据区域→插入图表→检查图表,描述数据特征。 常用图表类型 柱形图、折线图、饼图、雷达图、散点图、气泡图等。 考点二 大数据处理 一、大数据处理的基本思想与架构 基本思想:分治思想。 大数据处理类型 静态数据:已收集完成、计算时不变,采用批处理方式。 流数据:实时到达,价值随时间降低,需实时分析。 图数据:社交网络、道路交通等,采用图计算模式。 二、编程处理数据(Python) 常用扩展模块:numpy、scipy、pandas、matplotlib。 pandas 模块 引入:import pandas as pd Series:一维数据结构,含数据数组与索引,默认索引从 0 递增。 常用属性:index(索引)、values(数据数组) DataFrame:二维数据结构,由行索引与多列数据组成,是共享索引的 Series 集合。 常用属性:index(行索引)、columns(列标题)、values(二维数据)、T(行列转置) matplotlib 模块 引入:import matplotlib.pyplot as plt 用于快速绘图,设置坐标轴、刻度、图例等。 三、文本数据处理 应用场景 搜索引擎、情报分析、自动摘要、论文查重、文本分类、垃圾邮件过滤、机器翻译等。 典型过程:中文分词→特征提取→标签云等。 中文分词:基于词典、基于统计、基于规则三种方法。 特征提取:用字、词、短语表示文本特征。 标签云:用词频与字号体现关键词重要性。 四、数据可视化 概念:将数据以图形、图像形式呈现,直观展示信息。 作用:快捷观察追踪、实时分析、增强解释力与吸引力。 基本方法:时间趋势、比例、关系、差异、空间关系可视化。 五、大数据的典型应用 智能交通:整合物联网、大数据、云计算、人工智能。 电子商务:精准营销、供应链管理、智能网站。 考向突破 考向一 常用表格数据的处理 一、数据的计算 公式编辑 以 = 开头,乘号 *、除号 /、括号 (),乘号不可省略,不可用中括号 []。 单元格引用 连续区域:冒号连接(如 A8:C19) 不连续区域:逗号分隔(如 A8:C19,E8,E19) 绝对引用 行 / 列前加 $,固定行号 / 列号,避免自动填充时偏移。 常见错误类型 #DIV/0!:除零错误 #REF!:引用错误 #VALUE!:数据类型错误 #NAME?:函数名错误 ####:列宽不足 二、数据的排序与筛选 排序 选择连续数据区域→数据→排序→设置关键字→确定;主要关键字相同才看次要关键字。 筛选 仅隐藏不符合数据,可多列叠加筛选;“前十项” 可按项或百分比筛选,重复项一并显示。 三、数据图表呈现 数据源修改、排序、筛选后,图表会同步变化;先看图例,再看横坐标系列名判断数据源。 考向二 大数据处理 一、大数据处理系统 批处理:Hadoop(静态数据)、Spark(内存计算,速度更快) 流计算:Storm、Heron、S4(实时数据) 图计算:Neo4j、Pregel、GraphX(社交、网络关系数据) 二、pandas 常用操作 创建:pd.Series()、pd.DataFrame() 读取 / 导出:read_excel()、to_csv()等 常用函数:count()、sum()、mean()、max()、min()、describe()、groupby()、sort_values() 三、matplotlib 绘图函数 figure()、plot()(折线)、bar()(柱形)、barh()(水平柱形)、scatter()(散点)、title()、xlabel()、ylabel()、legend()、show() 一、例题 例 1(2022 宁波奉化期末,13) 小明收集部分高校哲学专业复试分数线数据如图 a: 表格 A B C D E F 1 部分高校 2021 年哲学专业考研复试分数线 2 院校名称 政治 外国语 业务课 1 业务课 2 总分 3 武汉大学 55 50 90 90 345 4 华中科技大学 55 55 105 105 365 5 南京大学 55 55 90 90 335 6 中南大学 55 55 90 90 325 7 复旦大学 55 55 90 90 355 8 湖南大学 50 50 90 90 360 9 重庆大学 50 50 80 80 320 10 西安交通大学 50 50 80 80 340 11 四川大学 55 55 80 80 325 12 山东大学 50 50 90 90 340 13 北京航空航天大学 45 45 80 80 320 14 东南大学 55 55 96 95 365 15 各校平均分 问题: (1) B15 单元格输入公式,自动填充 C15:F15,求各门课及总分平均分。 (2) 制作图 b 图表,数据区域是? (3) 以 “总分” 降序排列,排序区域是? 答案: (1) =AVERAGE(B3:B14) (2) A2:A14,F2:F14 (3) A2:F14 二、针对训练 1-1(2022 诸暨期末,13) 小明搜集 2016—2020 年各省(市)生产总值数据,用 Excel 处理。 问题: (1) 数据整理说法错误的是(单选) A. 缺失数据最简单方法是随机数填充 B. 重复数据可审核后合并 / 删除 C. 逻辑错误指属性值与实际不符 (2) G4 公式向下填充至 G34,再向右填充至 J 列,G4 公式应改为? (3) 图表说法正确的是(多选) A. 数据区域 A2:A5,A12,F2:F5,F12 B. 可更改图表类型 C. 柱形数值通过图例设置 D. 修改 F4,图表对应柱形不变 答案: (1) A (2) =(C4-$B4)/$B4*100 (3) AB 1-2(2022 诸暨海亮高级中学 3 月月考,17) 杭州市各区县(市)GDP 数据: 表格 A B C D E 2 地区 2019 年 (亿元) 2020 年 (亿元) 同比增幅 % 2020 年排名 3 上城区 1171.0 1192.1 1.8 5 ... ... ... ... ... ... 17 西湖名胜风景区 16.5 15.9 -3.5 15 问题: (1) D3 单元格公式(同比增幅 %=(2020 年 - 2019 年)/2019 年 ×100) (2) 对 2020 年列筛选:最大 30%,结果有__个 (3) 正确说法(多选) A. 2020 年 GDP 最高余杭区 B. C3:C17 设 2 位小数,图表会变 C. 按 2020 年降序排序,排名公式仍正确 D. 插入列,图表会改变 答案: (1) =(C3-B3)/B3*100 (2) 4 (3) AC 例 2(2022 杭嘉湖金四县区 5 月调研,13) Python 处理天气数据 weather.csv 问题: (1) 显示最高气温 > 35 度的站点信息 (2) 绘制各站点最高气温垂直柱形图 (3) Excel 平均温度 D2 公式 (4) Python 程序改错(找温度变化最大日期) 答案: (1) df (2) df2.index (3) =AVERAGE(B2:C2) 或 =(B2+C2)/2 (4) ① max=1 ② abs(int(df)-int(df))>abs(int(df)-int(df)) 2-1(2022 “南太湖” 联盟联考一,13) 成绩表:技术总分 E 列,排名 F 列 问题: (1) F2 公式=RANK(E2,E2:E393)有误,修改为? (2) Python 按班级求平均分并绘图,补全代码 答案: (1) =RANK(E2,$E$2:$E$393) (2) ① df.groupby ② plot 2-2(2022 绍兴柯桥期末,16) 2020 年城乡居民收入数据,Python 处理 问题: (1) 补全 Python 代码(计算收入、排位、绘水平柱形图) (2) 水平柱形图语句正确的是? 答案: (1) ① "2020年城乡居民收入情况.xlsx" ② sj+df ③ df.at (2) B