spark 應用場景2-身高統計

原文引自:http://blog.csdn.net/fengzhimohan/article/details/78564610

a. 案例描述

本案例假設我們需要對某個省的人口 (10萬) 性別還有身高進行統計,需要計算出男女人數,男性中的最高和最低身高,以及女性中的最高和最低身高。本案例中用到的源文件有以下格式, 三列分別是 ID,性別,身高 (cm),格式如下:?

b.人口數據的生成

利用Java語言隨機生成一組人口數據,包括序列ID,性別M/F,身高cm,代碼如下:

 1 import java.io.File;
 2 import java.io.FileWriter;
 3 import java.io.IOException;
 4 import java.util.Random;
 5 
 6 /**
 7  * Created by Administrator on 2017/11/13.
 8  */
 9 public class PeopleInfoFileGenerator {
10     public static void main(String[] args){
11         File file = new File("F:\\PeopleInfo.txt");
12 
13         try {
14             Random random = new Random();//生成隨機數
15             FileWriter fileWriter = new FileWriter(file);//新建一個文件
16             for (int i=1;i<=1000000;i++){   //生成10萬個數字
17                 int height = random.nextInt(220); 
18                 if (height < 50) {
19                     height = height + 50;
20                 }
21              String  gender = getRandomGender(); //性別方法
22              if (height < 100 && gender == "M") {
23                  height = height + 100;
24              }
25               if (height < 100 && gender == "F") {
26                   height = height + 40;
27               }
28              fileWriter.write( i + " " + getRandomGender() + " " + height); //文件格式:ID 性別 身高
29              fileWriter.write(System.getProperty("line.separator"));
30             }
31             fileWriter.flush();
32             fileWriter.close();
33             System.out.println("People Information File generated successfully.");
34         }catch (IOException e){
35             e.printStackTrace();
36         }
37     }
38 
39     public static String getRandomGender(){ //構建一個隨機生成性別方法
40         Random random = new Random();
41         int randomNum = random.nextInt(2) + 1;
42         if( randomNum % 2 == 0){
43             return "M";
44         }else{
45             return "F";
46         }
47     }
48 }

c. 實例過程分析

對于這個案例,我們要分別統計男女的信息,那么很自然的想到首先需要對于男女信息從源文件的對應的 RDD 中進行分離,這樣會產生兩個新的 RDD,分別包含男女信息;其次是分別對男女信息對應的 RDD 的數據進行進一步映射,使其只包含身高數據,這樣我們又得到兩個 RDD,分別對應男性身高和女性身高;最后需要對這兩個 RDD 進行排序,進而得到最高和最低的男性或女性身高。?
第一步,先分離男女信息,使用 filter 算子過濾條件包含”M” 的行是男性,包含”F”的行是女性;第二步我們需要使用 map 算子把男女各自的身高數據從 RDD 中分離出來;第三步我們需要使用 sortBy 算子對男女身高數據進行排序。

特別注意:RDD 轉化的過程中需要把身高數據轉換成整數,否則 sortBy 算子會把它視為字符串,那么排序結果就會受到影響,例如 身高數據如果是:123,110,84,72,100,那么升序排序結果將會是 100,110,123,72,84,顯然這是不對的。

d.求出身高統計代碼實現

 1 import org.apache.spark.SparkConf;
 2 import org.apache.spark.api.java.JavaRDD;
 3 import org.apache.spark.api.java.JavaSparkContext;
 4 import org.apache.spark.api.java.function.FlatMapFunction;
 5 import org.apache.spark.api.java.function.Function;
 6 import java.util.Arrays;
 7 /**
 8  * Created by Administrator on 2017/11/17.
 9  */
10 public class PeopleInfoCalculator {
11     public static void main(String[] args){
12         SparkConf sparkConf = new SparkConf().setAppName("PeopleInfoCalculator").setMaster("local[3]");
13         JavaSparkContext sc = new JavaSparkContext(sparkConf);
14         JavaRDD<String> dataFile = sc.textFile("F:\\PeopleInfo.txt");
15 
16         JavaRDD<String> maleFilterData = dataFile.filter(new Function<String, Boolean>() {//過濾出性別為M的數據
17             @Override
18             public Boolean call(String s) throws Exception {
19                 return s.contains("M");
20             }
21         });
22         JavaRDD<String> femaleFilterData = dataFile.filter(new Function<String, Boolean>() {//過濾出性別為F的數據
23             @Override
24             public Boolean call(String s) throws Exception {
25                 return s.contains("F");
26             }
27         });
28         JavaRDD<String> maleHeightData = maleFilterData.flatMap(new FlatMapFunction<String, String>() {//得到性別為M的身高數據
29             @Override
30             public Iterable<String> call(String s) throws Exception {
31                 return Arrays.asList(s.split(" ")[2]);
32             }
33         });
34         JavaRDD<String> femaleHeightData = femaleFilterData.flatMap(new FlatMapFunction<String, String>() {//得到性別為F的身高數據
35             @Override
36             public Iterable<String> call(String s) throws Exception {
37                 return Arrays.asList(s.split(" ")[2]);
38             }
39         });
40         JavaRDD<Integer> maleHeightDataInt = maleHeightData.map(new Function<String, Integer>() {//將字符串格式轉化為整型格式
41             @Override
42             public Integer call(String s) throws Exception {
43                 return Integer.parseInt(String.valueOf(s));
44             }
45         });
46         JavaRDD<Integer> femaleHeightDataInt = femaleHeightData.map(new Function<String, Integer>() {//將字符串格式轉化為整型格式
47             @Override
48             public Integer call(String s) throws Exception {
49                 return Integer.parseInt(String.valueOf(s));
50             }
51         });
52         //sortBy(<T>,ascending,numPartitions) 解釋:
53         //第一個參數是一個函數,該函數的也有一個帶T泛型的參數,返回類型和RDD中元素的類型是一致的;
54         //第二個參數是ascending,這參數決定排序后RDD中的元素是升序還是降序,默認是true,也就是升序;
55         //第三個參數是numPartitions,該參數決定排序后的RDD的分區個數,默認排序后的分區個數和排序之前的個數相等,即為this.partitions.size。
56         JavaRDD<Integer> maleHeightLowSort = maleHeightDataInt.sortBy(new Function<Integer,Integer>(){// true表示默認排序,為升序排序,從低到高排
57             public Integer call(Integer s) throws Exception {
58                 return s;
59             }
60         },true,3);
61         JavaRDD<Integer> femaleHeightLowSort = femaleHeightDataInt.sortBy(new Function<Integer,Integer>(){// true表示默認排序,為升序排序,從低到高排
62             public Integer call(Integer s) throws Exception {
63                 return s;
64             }
65         },true,3);
66         JavaRDD<Integer> maleHeightHightSort = maleHeightDataInt.sortBy(new Function<Integer,Integer>(){// false表示為降序排序,從高到低
67             public Integer call(Integer s) throws Exception {
68                 return s;
69             }
70         },false,3);
71         JavaRDD<Integer> femaleHeightHightSort = femaleHeightDataInt.sortBy(new         Function<Integer,Integer>(){// true表示默認排序,為降序排序,從低到高排
72             public Integer call(Integer s) throws Exception {
73                 return s;
74             }
75         },false,3);
76         Integer lowestMale = maleHeightLowSort.first(); //求出升序的第一個數,即最小值
77         Integer lowestFemale = femaleHeightLowSort.first();//求出升序的第一個數,即最小值
78         Integer highestMale = maleHeightHightSort.first();//求出降序的第一個數,即最大值
79         Integer highestFemale = femaleHeightHightSort.first();//求出降序的第一個數,即最大值
80 
81         System.out.println("Number of Female Peole:" + femaleHeightData.count());//求出女性的總個數
82         System.out.println("Number of Male Peole:" + maleHeightData.count());//求出男性的總個數
83         System.out.println("Lowest Male:" + lowestMale);//求出男性最矮身高
84         System.out.println("Lowest Female:" + lowestFemale);//求出女性最矮身高
85         System.out.println("Highest Male:" + highestMale);//求出男性最高身高
86         System.out.println("Highest Female:" + highestFemale);//求出女性最高身高
87 
88     }
89 }

?

e.運行結果:

?

轉載于:https://www.cnblogs.com/jinggangshan/p/8109329.html

本文來自互聯網用戶投稿,該文觀點僅代表作者本人,不代表本站立場。本站僅提供信息存儲空間服務,不擁有所有權,不承擔相關法律責任。
如若轉載,請注明出處:http://www.pswp.cn/news/252608.shtml
繁體地址,請注明出處:http://hk.pswp.cn/news/252608.shtml
英文地址,請注明出處:http://en.pswp.cn/news/252608.shtml

如若內容造成侵權/違法違規/事實不符,請聯系多彩編程網進行投訴反饋email:809451989@qq.com,一經查實,立即刪除!

相關文章

阿里云OSS linux使用備忘錄

ossutil config example: accessKeyId "AccessKeyId"; accessKeySecret "AccessKeySecret"; ###以上兩個在 https://help.aliyun.com/knowledge_detail/38738.html endPoint "http://oss-cn-beijing.aliyuncs.com";轉載于:https://www.cnblog…

纏繞多年的PCIE通道數問題終于完全明白了,歡迎指正

CPU的PCIE通道數&#xff0c;之前一直都是一個眾說紛紜的問題很多人都會問到&#xff0c;主板上不同的M.2接口&#xff0c;接SSD性能是否一樣&#xff0c;接太多的SSD&#xff0c;是否會占用顯卡的PCIE帶寬&#xff0c;今天我又看了幾篇網上的文章&#xff0c;終于十分清楚地搞…

vue-router實例

最近剛剛用vue寫了個公司項目&#xff0c;使用vue-cli構建的&#xff0c;算是中大型項目吧&#xff0c;然后這里想記錄并且分享一下其中的知識點&#xff0c;希望對大家有幫助,后期會逐漸分享&#xff1b;話不多說&#xff0c;直接上代碼&#xff01;&#xff01; app.vue 1 &l…

React學習小結(二)

一、組件的嵌套 1 <!DOCTYPE html>2 <html>3 <head>4 <meta charset"UTF-8">5 <title></title>6 <script src"react.min.js" type"text/javascript" charset"utf-8"></script>7 <…

PCIE2.0/PCIE3.0/PCIE4.0/PCIE5.0接口的帶寬、速率計算

一、PCIE接口速率&#xff1a; 二、PCIE相關概念&#xff1a; 傳輸速率為每秒傳輸量GT/s&#xff0c;而不是每秒位數Gbps&#xff0c;因為傳輸量包括不提供額外吞吐量的開銷位&#xff1b; 比如 PCIe 1.x和PCIe 2.x使用8b / 10b編碼方案&#xff0c;導致占用了20% &#xff08…

華為交換機同一vlan不同網段的通信

在VLANIF接口下配置主從IP地址&#xff0c;可以實現同一VLAN多個網段用戶間的互通。 某VLAN10內兩個主機Host_1和Host_2分別屬于網段10.1.1.1/24和10.1.2.1/24&#xff0c;要求兩主機互通。 可以在Switch上進行如下配置&#xff1a; [Switch] interface gigabitethernet 0/0/1 …

hql語法

HQL查詢&#xff1a;Criteria查詢對查詢條件進行了面向對象封裝&#xff0c;符合編程人員的思維方式&#xff0c;不過HQL(Hibernate Query Lanaguage)查詢提供了更加豐富的和靈活的查詢特性&#xff0c;因此Hibernate將HQL查詢方式立為官方推薦的標準查詢方式&#xff0c;HQL查…

四五月份:關鍵詞是溝通、繪畫和SQL

例行總結一下四五月份的感受。 關鍵詞有三個&#xff1a;溝通、繪畫和SQL。 整體來說&#xff0c;這兩個月在努力跟這三個關鍵詞死磕&#xff0c;略有些進展&#xff0c;因此匯報一下。 雖然這三個關鍵詞從重要度來說是從左到右的&#xff0c;但從敘述來講&#xff0c;還是先從…

InfiniBand簡介

一&#xff0e;什么是infiniband InfiniBand架構是一種支持多并發鏈接的“轉換線纜”技術&#xff0c;它是新一代服務器硬件平臺的I/O標準。由于它具有高帶寬、低延時、 高可擴展性的特點&#xff0c;它非常適用于服務器與服務器&#xff08;比如復制&#xff0c;分布式工作等…

程序員的視角:java GC

GC&#xff08;Garbage Collection 垃圾回收&#xff09;的概念隨著 java 的流行而被人們所熟知。 實際 GC 最早起源于20世紀60年代的 LISP 語言&#xff0c;是一種自動的內存管理機制。 GC 要解決的問題有 3 個&#xff1a;1. 回收什么&#xff1f;&#xff08;what&#xff0…

spring mvc攔截器HandlerInterceptor

本文主要介紹springmvc中的攔截器&#xff0c;包括攔截器定義和的配置&#xff0c;然后演示了一個鏈式攔截的測試示例&#xff0c;最后通過一個登錄認證的例子展示了攔截器的應用 攔截定義 定義攔截器&#xff0c;實現HandlerInterceptor接口。接口中提供三個方法。 public cla…

mysql show 語句大全

mysql show 語句大全 show open tables; 基于本人對MySQL的使用&#xff0c;現將常用的MySQL show 語句列舉如下&#xff1a; 1.show databases ; // 顯示mysql中所有數據庫的名稱 2.show tables [from database_name]; // 顯示當前數據庫中所有表的名稱 3.show columns from …

阿里云Aliplayer高級功能介紹(一):視頻截圖

基本介紹H5 Video是不提供截圖的API的&#xff0c; 視頻截圖需要借助Canvas&#xff0c;通過Canvas提供的drawImage方法&#xff0c;把Video的當前畫面渲染到畫布上&#xff0c; 最終通過toDataURL方法可以導出圖片的base64編碼&#xff0c;基本就完成了圖片截圖的功能。 功能實…

POJ 1151 Atlantis 線段樹+掃描線

解題思路: 先將y軸進行離散化。n個矩形的2n個橫邊縱坐標共構成最多2n-1個區間的邊界&#xff0c;對這些區間編號&#xff0c;建立起線段樹。 x軸記錄左邊和右邊&#xff0c;左邊時是矩形面積增加&#xff0c;覆蓋層數增加邊&#xff0c;右邊是形面積減少&#xff0c;覆蓋層數減…

分頁

1.首先在數據庫中建立一個視圖&#xff08;在aspx中sql查詢語句是view_student不是student&#xff09;&#xff0c;在視圖里創建create view view_student--創建視圖as row_number 行號 一條數據是一行 分頁功能要根據行數運算select *,row_number() over(order by stuNo desc…

NFS服務端的安裝

執行以下四步操作即可完成在虛擬機上安裝完成NFS的服務端&#xff1a;第一步&#xff1a;在虛擬機上安裝nfs服務&#xff1a; sudo apt install nfs-kernel-server 第二步&#xff1a;修改文件 sudo vi /etc/exports 在文件末尾增加 /home/zzf/hisi-sdk 192.16…

【C++STL/紅黑樹】POJ 3481 DoubleQueue

POJ 3481 Double Queue 描述&#xff1a; 新成立的BIG-Bank在不切雷斯特開了一間新辦公室,使用了由IBM羅馬尼亞的現代計算機辦公環境,運用了現代信息技術.一般來說,銀行的每個顧客都有一個識別碼K,并且每一個來銀行的顧客都會被給予一個優先級P.銀行主管的一個大膽想法震驚了公…

基礎表單筆記

表單數據要向服務端提交的話 每個表單都要指定一些屬性就是name""和value"" value就是用戶寫什么就是什么 來提交name就是對這個表單進行一個標識 <from> 輸入用戶名<input type"text" name"user" value""/>這…

PCIE總線-PCI、PCIE關系及信號定義

PCI(Peripheral Component Interconnect)總線規范在上世紀九十年代由Intel提出。在處理器體系結構中&#xff0c;PCI總線屬于局部總線(Local Bus)。局部總線作為系統總線的延伸&#xff0c;主要功能是為了連接外部設備。 處理器主頻的不斷提升&#xff0c;要求速度更快&#x…