Hadoop面向年轻数据科学家

Hadoop For Young(ไม่เป็น)数据科学家

面向年轻数据科学家课程的Hadoop结论

数据科学家泰国数据科学家泰国数据科学家

จุดประสงค์อีกอย่างคือต้องการสรุปเรียบเรียงสิ่งที่ตัวเองไปเรียนมาด้วย

ซึ่งสิ่งที่จะมาเล่าต่อไปนี้ขอ้ำว่้ำว่าต่นการเล่าเพาะเาต่อไปนี้าว่อ่าไว้ได้เลอ่าแล้วเห็าไว้ได้เลาใจามเข้าใจอใจ

อนอื่นต้องเล่าก่อนว่าHadoopคืออะไรสินะ?

– Hadoop数据中心大数据ก็คื大数据ก็คือมูลที่มีทั้งแบบอมูลขนาดใหญ่ซึ่งข้อมูลขนาดใหญ่ในความเข้าใจเราก็คือข้อมูลที่มีทั้งแบบ结构และ非结构แบบนได้ตลอดเวลาถ้าเทียบกับข้อมูลที่เราเก็บกับแบบเดิมที่เป็นแบบ结构ซะส่วนใหญ่เช่นบริษัทอย่างพวกธนาคารข้อมูล交易ก็ถือว่าเป็นข้อมูล Dataนตลอดเวลาเหมือนกันแต่เราว่ามันต่างกับคำว่า大数据อามนิดนึงตรงที่พอมีคำว่า大数据transactionอมูลสถานที่ที่ลูกค้าถอนเงินข้อิงๆข้าที่ลูกค้าถอนเงินซึ่งจริงๆข้อมูลพวกนี้ก็ต้องมีเก็บอยู่ใน交易 历史หรหอ日志ธรมดรlogาพอต่อมาเริ่มมีเทคโนโลรีการ การนำมาพยากรณ์เพื่อส่งเสริมการตัดสินใจหรือวางกลยุทธ์เพิ่มลูกค้าเพิ่มยอดขายกันต่อไปอ่ะ! Hadoop Hadoop分布式系统 (5555)

งรงสร้างHadoop

จะเป็นดังรูปนี้

Hadoop分层存储分层存储目录分层存储目录งดูๆยนด้วยภาษาจาว่าตอนแรกลองดูๆ教程 555)พงที่บงที่บทำทำทำทำทำทำทำทำทำทำทำทำทำังมีังมีังมีังมีังมีังมี เข้ามาช่วยในขั้นตอนต่างๆของการวิเคราะห์ข้อมูล

ใช้อของเครื่องมือที่เกี่ยวข้องกับการใช้Hadoopมีอะไรบ้าง?

Dataาหรเคยลองไปด้อมๆมองๆเสิชข้อมูลเกี่ยวกับHadoopหรือเครื่องมือที่ใช้ในการจัดการBig Dataจะเห็นว่ามันเยอะมากกกกกกกกกกกกกกกกมีเครื่องมือล้านแปดให้เลือกใช้แต่หลักๆนจะสรุป ได้ตามรูปนี้

งาจำไม่ผิดเครื่องมือทั้งหมดนมนของApacheและมันเป็น开源จ้ามาดูแต่ละชั้นกันดีกว่า

ตัวริ่มจากชั้นบนสุดจะเป็นตัวUI

– Ambari UIน้าที่เป็นหน้าUIให้เราจัดการเครื่องมือต่างๆในชั้นล่างๆลงมา

ด้านซ้ายมือสุดจะเป็นเครื่องที่ใช้ในการดึงข้อมูล

– Flumeเป็นตัวที่ใช้ดึงข้อมูลจะใช้กับพวกTwitter APIและไว้สำหรับดึงข้อมูลจากหลายๆที่ได้

– Sqoopเป็นตัวดึงข้อมูลเช่นกันและสามารถทำ可视化ได้

–动物园管理员ทำหน้าที่เป็นเหมือน防火墙ของข้อมูลที่นำเข้ามาเป็นหน่วย安全อะไรแบบนั้น

มณ์นถัดมาจะเป็นส่วนขอขนที่นำข้อมูลมาประมวลผลหรือเรียกว่าวิเคราะห์เบื้องต้นอะไรทำนองนั้นจากที่ลองเล่นดูก็จะเป็นอารมณ์queryข้อมูลที่จำเป็นต้องใช้ขึ้นมาซึ่งแต่ละตัวมันก็จะมีความสามารา ต่างกันอยู่ที่ว่างานเราต้องการทำแบบไหนบ้างก็จะมีให้เลือกใช้ดังนี้

–应用程序应用程序Hadoop Hadoop流程图流程图作业调度程序ได้

–猪ใช้จัดการเอมูลภาษาจะคล้ายๆsqlเรียกว่าPig拉丁语

– Mahountใช้ทำ机器学习

– R连接器(ในกรณีใช้ภาษาR)

– Hiveจัดการข้อมูลที่เป็น结构

– HBASE structureนี้จะสามารถจัดการกับข้อมูลทั้ง结构และUn结构

HDFS YA YARN Map Reducedมัื่ื่ื่ออออู่ที่เMap Mapกแบบให้เข้

Hadoop分布式???

– Hadoop分布式Hadoop分布式Hadoop分布式Hadoop ซึ่งที่เรือออกแบบให้เข้ากับของแต่ละบริษัทเท่านั้นซึ่งที่เรียนมาก็จะมีดังนี้

o Map Rข้อดีคือไม่จำเป็นต้องดึงข้อมูลจากHDFS(DrillมีคุณสมบัติเหมือนHiveแต่เป็นของMap Rพัฒนาเอง)ข้อดีคือเราใช้datasourceได้หลายที่

o IBM InfoSphere BigInsignts for Hadoop tsรปากับ服务ของIBM

o Pivotal HD戴尔

o Hortonworks纯粹的Hadoop Hadoop集群中的Hadoop

o Cloudera(โครโคร้างเหมือนHadoop)

cloudรื่องมือcloudera经理และHueทำหน้าที่เหมือนกับambari

impalaทำหน้าที่เหมือนกับHiveแต่impalaเร็วกว่าhive

พูดถึงอไปมาพูดถึงCloud Platformที่ใช้ลงเจ้าเครื่องมือต่างๆที่พูดถึงข้างบนกัน?

– Cloud Platformในการลง工具ต่างๆที่กล่าวมาด้านบนเราก็ต้องลงแต่ละตัวและconfigเองเอาง่ายๆว่าน่าจะคล้ายๆกับการๆกับกระกอบคอมพ์เองแหละมั้งแต่ถ้าเรา ใช้Cloud Platformเราก็จะไม่ต้องมานั่งลงแต่ละอย่างและ配置เอเยุ่งยากเหมาะกับสาวๆที่geekไม่สุดอย่างเราเฮ่!!

云端平台Microsoft Azure平台555平台HorนworksนHortonworks Sandbox with HDP 2.4(Platformพวกนี้จริงๆก็ยังไม่ค่อยรู้จักเท่าไหร่ไม่ แล้วก็กดน่ใจว่าตัวไหนมีเครื่องมืออะไรให้ใช้บ้าง)แล้วก็กด单击ระบบก็จะdeployให้เสร็จสรรพ

อีกสองย่างที่ได้รู้จักก็คือ

1.เวลาที่เราทำงานจริงและใช้เป็น服务器生产เราจะต้องมีการสร้าง云端中断เพื่อสร้าง群集และสร้างแต่ละ节点ซึ่งแต่ละnodeหมายถึงเครื่อง客户端แต่ละเครื่องที่จะทำงานร่วมกันในทีมนทีมนี่แหละซึ่งการสร้าง集群เราสาส งร้างได้จากการสร้างambaryก่อนก็ได้แล้วค่อยๆสร้างชั้นอื่นๆตามลำดับ

2.งรเพื่าง笔记本เพื่อtestรกนจากZeppelinได้ตัวนี้ที่เข้าใจน่าจะเป็นตัวที่สร้างขึ้นเพื่อใช้เทสระบบในขั้นทดลองกับทีม

จากที่เล่าๆและสรุปมาทั้งหมดรายละเอียดเครื่องมือแต่ละตัวเอาจริงๆก็ยังไม่เข้าใจเพราะยังไม่เคยลองเล่นทุกตัวแต่หลักๆคือเราต้องรงาคุณสมบัติแต่ละตัวทำอะไรได้บ้างเพื่อสามาราอถเลืากให้เหมอ จะทำได้

จบ…..