Hadoop For Young(ไม่เป็น)数据科学家
面向年轻数据科学家课程的Hadoop结论
数据科学家泰国数据科学家泰国数据科学家
จุดประสงค์อีกอย่างคือต้องการสรุปเรียบเรียงสิ่งที่ตัวเองไปเรียนมาด้วย
ซึ่งสิ่งที่จะมาเล่าต่อไปนี้ขอ้ำว่้ำว่าต่นการเล่าเพาะเาต่อไปนี้าว่อ่าไว้ได้เลอ่าแล้วเห็าไว้ได้เลาใจามเข้าใจอใจ
อนอื่นต้องเล่าก่อนว่าHadoopคืออะไรสินะ?
– Hadoop数据中心大数据ก็คื大数据ก็คือมูลที่มีทั้งแบบอมูลขนาดใหญ่ซึ่งข้อมูลขนาดใหญ่ในความเข้าใจเราก็คือข้อมูลที่มีทั้งแบบ结构และ非结构แบบนได้ตลอดเวลาถ้าเทียบกับข้อมูลที่เราเก็บกับแบบเดิมที่เป็นแบบ结构ซะส่วนใหญ่เช่นบริษัทอย่างพวกธนาคารข้อมูล交易ก็ถือว่าเป็นข้อมูล Dataนตลอดเวลาเหมือนกันแต่เราว่ามันต่างกับคำว่า大数据อามนิดนึงตรงที่พอมีคำว่า大数据transactionอมูลสถานที่ที่ลูกค้าถอนเงินข้อิงๆข้าที่ลูกค้าถอนเงินซึ่งจริงๆข้อมูลพวกนี้ก็ต้องมีเก็บอยู่ใน交易 历史หรหอ日志ธรมดรlogาพอต่อมาเริ่มมีเทคโนโลรีการ การนำมาพยากรณ์เพื่อส่งเสริมการตัดสินใจหรือวางกลยุทธ์เพิ่มลูกค้าเพิ่มยอดขายกันต่อไปอ่ะ! Hadoop Hadoop分布式系统 (5555)
งรงสร้างHadoop
จะเป็นดังรูปนี้

Hadoop分层存储分层存储目录分层存储目录งดูๆยนด้วยภาษาจาว่าตอนแรกลองดูๆ教程 555)พงที่บงที่บทำทำทำทำทำทำทำทำทำทำทำทำทำังมีังมีังมีังมีังมีังมี เข้ามาช่วยในขั้นตอนต่างๆของการวิเคราะห์ข้อมูล
ใช้อของเครื่องมือที่เกี่ยวข้องกับการใช้Hadoopมีอะไรบ้าง?
Dataาหรเคยลองไปด้อมๆมองๆเสิชข้อมูลเกี่ยวกับHadoopหรือเครื่องมือที่ใช้ในการจัดการBig Dataจะเห็นว่ามันเยอะมากกกกกกกกกกกกกกกกมีเครื่องมือล้านแปดให้เลือกใช้แต่หลักๆนจะสรุป ได้ตามรูปนี้

งาจำไม่ผิดเครื่องมือทั้งหมดนมนของApacheและมันเป็น开源จ้ามาดูแต่ละชั้นกันดีกว่า
ตัวริ่มจากชั้นบนสุดจะเป็นตัวUI
– Ambari UIน้าที่เป็นหน้าUIให้เราจัดการเครื่องมือต่างๆในชั้นล่างๆลงมา
ด้านซ้ายมือสุดจะเป็นเครื่องที่ใช้ในการดึงข้อมูล
– Flumeเป็นตัวที่ใช้ดึงข้อมูลจะใช้กับพวกTwitter APIและไว้สำหรับดึงข้อมูลจากหลายๆที่ได้
– Sqoopเป็นตัวดึงข้อมูลเช่นกันและสามารถทำ可视化ได้
–动物园管理员ทำหน้าที่เป็นเหมือน防火墙ของข้อมูลที่นำเข้ามาเป็นหน่วย安全อะไรแบบนั้น
มณ์นถัดมาจะเป็นส่วนขอขนที่นำข้อมูลมาประมวลผลหรือเรียกว่าวิเคราะห์เบื้องต้นอะไรทำนองนั้นจากที่ลองเล่นดูก็จะเป็นอารมณ์queryข้อมูลที่จำเป็นต้องใช้ขึ้นมาซึ่งแต่ละตัวมันก็จะมีความสามารา ต่างกันอยู่ที่ว่างานเราต้องการทำแบบไหนบ้างก็จะมีให้เลือกใช้ดังนี้
–应用程序应用程序Hadoop Hadoop流程图流程图作业调度程序ได้
–猪ใช้จัดการเอมูลภาษาจะคล้ายๆsqlเรียกว่าPig拉丁语
– Mahountใช้ทำ机器学习
– R连接器(ในกรณีใช้ภาษาR)
– Hiveจัดการข้อมูลที่เป็น结构
– HBASE structureนี้จะสามารถจัดการกับข้อมูลทั้ง结构และUn结构
HDFS YA YARN Map Reducedมัื่ื่ื่ออออู่ที่เMap Mapกแบบให้เข้
Hadoop分布式???
– Hadoop分布式Hadoop分布式Hadoop分布式Hadoop ซึ่งที่เรือออกแบบให้เข้ากับของแต่ละบริษัทเท่านั้นซึ่งที่เรียนมาก็จะมีดังนี้
o Map Rข้อดีคือไม่จำเป็นต้องดึงข้อมูลจากHDFS(DrillมีคุณสมบัติเหมือนHiveแต่เป็นของMap Rพัฒนาเอง)ข้อดีคือเราใช้datasourceได้หลายที่
o IBM InfoSphere BigInsignts for Hadoop tsรปากับ服务ของIBM
o Pivotal HD戴尔
o Hortonworks纯粹的Hadoop Hadoop集群中的Hadoop
o Cloudera(โครโคร้างเหมือนHadoop)
cloudรื่องมือcloudera经理และHueทำหน้าที่เหมือนกับambari
impalaทำหน้าที่เหมือนกับHiveแต่impalaเร็วกว่าhive
พูดถึงอไปมาพูดถึงCloud Platformที่ใช้ลงเจ้าเครื่องมือต่างๆที่พูดถึงข้างบนกัน?
– Cloud Platformในการลง工具ต่างๆที่กล่าวมาด้านบนเราก็ต้องลงแต่ละตัวและconfigเองเอาง่ายๆว่าน่าจะคล้ายๆกับการๆกับกระกอบคอมพ์เองแหละมั้งแต่ถ้าเรา ใช้Cloud Platformเราก็จะไม่ต้องมานั่งลงแต่ละอย่างและ配置เอเยุ่งยากเหมาะกับสาวๆที่geekไม่สุดอย่างเราเฮ่!!
云端平台Microsoft Azure平台555平台HorนworksนHortonworks Sandbox with HDP 2.4(Platformพวกนี้จริงๆก็ยังไม่ค่อยรู้จักเท่าไหร่ไม่ แล้วก็กดน่ใจว่าตัวไหนมีเครื่องมืออะไรให้ใช้บ้าง)แล้วก็กด单击ระบบก็จะdeployให้เสร็จสรรพ
อีกสองย่างที่ได้รู้จักก็คือ
1.เวลาที่เราทำงานจริงและใช้เป็น服务器生产เราจะต้องมีการสร้าง云端中断เพื่อสร้าง群集และสร้างแต่ละ节点ซึ่งแต่ละnodeหมายถึงเครื่อง客户端แต่ละเครื่องที่จะทำงานร่วมกันในทีมนทีมนี่แหละซึ่งการสร้าง集群เราสาส งร้างได้จากการสร้างambaryก่อนก็ได้แล้วค่อยๆสร้างชั้นอื่นๆตามลำดับ
2.งรเพื่าง笔记本เพื่อtestรกนจากZeppelinได้ตัวนี้ที่เข้าใจน่าจะเป็นตัวที่สร้างขึ้นเพื่อใช้เทสระบบในขั้นทดลองกับทีม
จากที่เล่าๆและสรุปมาทั้งหมดรายละเอียดเครื่องมือแต่ละตัวเอาจริงๆก็ยังไม่เข้าใจเพราะยังไม่เคยลองเล่นทุกตัวแต่หลักๆคือเราต้องรงาคุณสมบัติแต่ละตัวทำอะไรได้บ้างเพื่อสามาราอถเลืากให้เหมอ จะทำได้
จบ…..