ศูนย์ข้อมูล AI คืออะไร?

ศูนย์ข้อมูล AI คืออะไร? [วิดีโอและแบบทดสอบ]

คำตอบสั้นๆ: ศูนย์ข้อมูล AI คือ มีความหนาแน่นสูง ซึ่งพลังงาน การระบายความร้อน โครงสร้างพื้นฐาน และพื้นที่จัดเก็บข้อมูลถูกออกแบบมาเพื่อรองรับการฝึกฝนและการให้บริการโมเดล ไม่ใช่ห้องเซิร์ฟเวอร์ที่มี GPU เพิ่มเติม ชิปเป็นตัวกำหนดว่า ตัวอาคาร ตัดสิน หากภาพไม่สามารถส่งออกไปได้ ก็ควรปรับปรุงพื้นที่ให้เป็นเซลล์ขนาดเล็ก ทีมส่วนใหญ่ควรเช่าพื้นที่

ประเด็นสำคัญ:

ชิปกับตัวประกอบ: พลังงาน การระบายความร้อน โครงสร้าง และพื้นที่จัดเก็บข้อมูล เป็นตัวตัดสินว่าตัวเร่งความเร็วจะทำงานได้หรือไม่

สถานที่ไม่ใช่พระราชวัง: ติดตั้งแร็คสองชั้นเมื่อไม่สามารถส่งข้อมูลออกไปได้ อย่าซื้อพื้นที่สำหรับวิทยาเขตขนาดใหญ่

ค่าเฉลี่ยเทียบกับค่ามัธยฐาน: ในการทดลอง 8 ครั้ง ค่ามัธยฐานบดบังการเริ่มต้นใหม่ ดังนั้นจึงควรใช้ค่าเฉลี่ยในช่วง 18 ชั่วโมง

ความทนทานต่อการใช้งานผิดวิธี: ห้ามระบุค่า PUE สำหรับชั้นวางสินค้าสองชั้นในห้องโถงอเนกประสงค์

ผลลัพธ์ที่แสดงให้เห็น: การวิ่งแปดรอบนั้นใช้แผนที่ขนาดเล็ก ไม่ได้ช่วยประหยัดต้นทุนการผลิตถึง 50%

บทความที่คุณอาจสนใจอ่านต่อหลังจากบทความนี้:

🔗 AI เชื่อถือได้จริงหรือไม่? วิดีโอและแบบทดสอบ
สำรวจความน่าเชื่อถือของ AI ผ่านวิดีโอที่น่าสนใจและแบบทดสอบแบบโต้ตอบ

🔗 วิธีใช้ AI ในชีวิตประจำวัน
ค้นพบวิธีปฏิบัติที่ AI สามารถช่วยลดความซับซ้อนของงานและกิจวัตรประจำวันได้

🔗 วิธีการใช้ AI ในที่ทำงาน
เรียนรู้แนวทางปฏิบัติในการใช้ AI เพื่อเพิ่มประสิทธิภาพการทำงานในที่ทำงานให้ชาญฉลาดขึ้น

🔗 ปัญญาประดิษฐ์คิดเองได้หรือไม่?
ทำความเข้าใจว่าปัญญาประดิษฐ์สามารถคิดอย่างอิสระหรือใช้เหตุผลได้จริงหรือไม่

มันแตกต่างจากศูนย์ข้อมูล "ทั่วไป" อย่างไร

ห้องโถงแบบดั้งเดิมได้รับการออกแบบมาเพื่อรองรับปริมาณงานที่หลากหลายและความเสถียรของระบบบริการขนาดเล็กจำนวนมาก คุณใส่ใจเรื่องความซ้ำซ้อนอย่างแน่นอน และใส่ใจเรื่อง PUE ( พลังงานส่วนเกินที่อาคารใช้ไปเพื่อส่งมอบกำลังประมวลผลหนึ่งวัตต์) แต่โดยทั่วไปแล้ว คุณจะไม่ออกแบบทางเดินทุกแห่งโดยคำนึงถึงตู้แร็คที่ทำหน้าที่เหมือนเครื่องทำความร้อนเคลื่อนที่

เว็บไซต์ AI เปลี่ยนอัตราส่วน ความหนาแน่นเพิ่มสูงขึ้น เครือข่ายกลายเป็นโครงสร้างพื้นฐานที่งานฝึกอบรมไม่สามารถดำเนินต่อไปได้หากปราศจากมัน พื้นที่จัดเก็บข้อมูลต้องคอยอัปเดตจุดตรวจสอบอยู่เสมอ มิฉะนั้นตัวเร่งความเร็วจะหยุดนิ่ง เหมือนม้าแข่งที่ติดอยู่ในการจราจรติดขัด.

นอกจากนี้ยังมีความแตกต่างทางวัฒนธรรมด้วย ฝ่ายปฏิบัติการขององค์กรคิดในแง่ของตั๋วและช่วงเวลาการเปลี่ยนแปลง ส่วนฝ่ายปฏิบัติการ AI คิดในแง่ของคิวงานและความรู้สึกแย่ๆ เมื่อโหนดใดโหนดหนึ่งล้มเหลวในช่วงท้ายของการทำงานระยะยาว ผมคิดว่าคุณยังคงเรียกทั้งสองอย่างว่า "ศูนย์ข้อมูล" ได้ เพราะมันก็คือศูนย์ข้อมูลนั่นเอง เพียงแต่ชื่อเรียกนั้นซ่อนกลไกภายในเอาไว้.

พิมพ์ มันถูกสร้างขึ้นมาเพื่ออะไร ฮาร์ดแวร์ที่โดดเด่น ลักษณะกำลัง/การระบายความร้อน เหมาะกับใคร เหตุผลที่มันมีอยู่
ศูนย์ข้อมูลองค์กรแบบดั้งเดิม ระบบไอทีแบบผสมผสาน: ฐานข้อมูล, เครื่องเสมือน (VM), อีเมล, ไฟล์ ซีพียู เซิร์ฟเวอร์ทั่วไป อุปกรณ์จัดเก็บข้อมูลที่คุ้นเคย ระบบระบายอากาศ; ความหนาแน่นปานกลาง; ค่า PUE เป็นประเด็นสำคัญ บริษัทที่ดำเนินงานระบบในชีวิตประจำวัน หมั่นอัปเดตแอปพลิเคชันทางธุรกิจอยู่เสมอ
กลุ่มฝึกอบรม AI งานฝึกอบรมระยะยาวที่เชื่อมโยงกันอย่างแน่นหนา แร็คเร่งความเร็วหนาแน่น; การเชื่อมต่อ GPU ความหนาแน่นสูง; การระบายความร้อนด้วยของเหลว หรือ [เครื่องแลกเปลี่ยนความร้อนแบบประตูหลัง](https://datacenters.lbl.gov/sites/default/files/rdhx-doe-femp.pdf) ห้องปฏิบัติการและผู้สร้างแบบจำลองต่าง ๆ ใช้ชีวิตอยู่ในคิวงาน จบการวิ่งโดยไม่ปล่อยให้ชิปอดอาหาร
สิ่งอำนวยความสะดวกในการอนุมาน AI การให้บริการโมเดล; การตอบคำถามแบบเรียลไทม์และแบบกลุ่ม ตัวเร่งความเร็ว; ตัวปรับสมดุลโหลดที่สำคัญ ยังคงร้อนแรงอยู่ แต่...ดูไม่อลังการเท่าเดิม เน้นความหน่วงมากกว่าความหนาแน่นของข้อมูล ผลิตภัณฑ์ที่ต้องตอบกลับในตอนนี้ วางโมเดลไว้ใกล้ผู้ใช้
ห้องโถง AI ไฮบริด ฝึกฝนและปฏิบัติงานภายใต้หลังคาเดียวกัน...ก็ประมาณนั้นแหละ ราวแขวนผ้าแบบผสม; สระน้ำมีรั้วกั้น; พื้นที่ส่วนกลาง สองบุคลิกที่ชอบความเย็นอยู่ในห้องเดียวกัน...มันเลยดูอึดอัด ทีมที่ไม่สามารถมีวิทยาเขตสองแห่งได้ ทุนมีจำกัด ชีวิตไม่แน่นอน

ไม่ใช่การจัดอันดับทางศีลธรรม เครื่องจักรต่างกัน แต่ใช้ชื่อตระกูลเดียวกัน.

การ์ดจอ ตัวเร่งความเร็ว และแร็คที่กินไฟมาก

เมื่อเดินไปตามชั้นวางสินค้าแบบดั้งเดิม ชั้นวางเหล่านั้นดูสุภาพเรียบร้อยดี แต่ถ้าเดินไปตามแถวชั้นวางสินค้าที่ใช้ปัญญาประดิษฐ์ (AI) พวกมันดูเหมือนอยากจะกลืนกินอาคารทั้งหลังไปเลย.

ฮาร์ดแวร์ที่โดดเด่นไม่ใช่ซีพียูอัจฉริยะ แต่เป็นถาดเร่งความเร็ว: จีพียูหรือชิป AI อื่นๆ ที่บรรจุอยู่ในเซิร์ฟเวอร์ จากนั้นในแร็ค แล้วเรียงเป็นแถวที่ใช้เครือข่ายแบนด์วิดท์สูงร่วมกัน การเชื่อมต่อจีพียูจะเชื่อมต่อชิปเข้าด้วยกันจนดูเหมือนเป็นตัวเร่งความเร็วขนาดใหญ่ตัวเดียวเครือข่ายคลัสเตอร์ก็ทำเช่นเดียวกันในระดับแถว การฝึกอบรมแบบขนานจะใช้งานได้ก็ต่อเมื่อลิงก์เหล่านั้นมีความเร็วสูงและคาดการณ์ได้ หากสูญเสียสิ่งนั้นไป "คลัสเตอร์" ของคุณก็จะเป็นเพียงกองเวิร์กสเตชันราคาแพงที่ใช้ที่อยู่เดียวกัน

พลังงานจะไหลไปตามชิป ไม่ใช่จาก PDU ขนาดใหญ่ในสำนักงาน แต่เป็นพลังงานระดับเมกะวัตต์ของโหลดไอทีเมื่อห้องโถงเต็มไปด้วยอุปกรณ์ – ผมจะไม่สมมติตัวเลขขึ้นมา ความหนาแน่นต่อแร็คคือจุดพลิกผัน ยิ่งมีแร็คน้อยเท่าไหร่ แต่ละแร็คก็ยิ่งเหมือนเตาเผาขนาดเล็กเท่านั้น ปัจจัยจำกัดมักอยู่ที่สถานีจ่ายไฟ ไม่ใช่รายการ GPU ที่ต้องการ คุณก็รู้ว่ามันเป็นอย่างไร ฝ่ายจัดซื้อต้องการตัวเร่งความเร็วเพิ่ม ฝ่ายสาธารณูปโภคต้องการการสนทนาที่ยาวนานและเช็คก้อนโต.

มีคำเปรียบเทียบที่ฟังดูงี่เง่าเล็กน้อยที่ผมสลัดทิ้งไม่ได้ คือ ราวแขวนผ้าก็เหมือนสัตว์ที่หิวโหย คุณสามารถเพาะพันธุ์ให้มันวิ่งเร็วขึ้นได้ แต่คุณก็ยังต้องให้อาหารมัน และคุณก็ยังต้องทำความสะอาดเพื่อระบายความร้อนอยู่ดี ถ้าละเลยอย่างใดอย่างหนึ่ง มันก็จะกลายเป็นที่ทับกระดาษราคาแพงไปเปล่าๆ.

ปัญหาเรื่องพลังงาน ความร้อน และการระบายความร้อน

ไฟฟ้าเข้า ความร้อนออก นั่นคือหลักการทั้งหมดของศาสนานี้.

ชั้นวางสินค้าที่มีความหนาแน่นสูงระบายความร้อนในแบบที่อากาศไม่เคยถูกออกแบบมาให้รับมือได้คุณอาจใช้แรงดันอากาศมากขึ้น เช่น เครื่องแลกเปลี่ยนความร้อนที่ประตูหลัง ทางเดินที่ร้อนกว่า การกักเก็บความร้อนอย่างชาญฉลาด ซึ่งได้ผลในระดับหนึ่ง แต่หลังจากนั้นของเหลวก็เข้ามามีบทบาท:

  • การระบายความร้อนโดยตรงไปยังชิป

  • วงจรสารหล่อเย็นที่ทำให้ห้องเครื่องดูเหมือนโรงงานเคมี

  • การดื่มด่ำกับดีไซน์บางแบบ ซึ่งยังคงทำให้คนที่คิดว่าน้ำและเซิร์ฟเวอร์ไม่ควรอยู่ด้วยกันต้องตกใจ

ทั้งหมดนี้ไม่ได้ดูหรูหราอะไรเลย ทุกอย่างเป็นเพราะตัวผลิตภัณฑ์เอง เพราะคันเร่งที่จำกัดการทำงานก็คือสิ่งที่คุณจ่ายเงินไปแล้วแต่ไม่สามารถใช้งานได้อย่างเต็มที่.

ค่า PUE ยังคงมีความสำคัญ มันเป็นอัตราส่วน ไม่ใช่ลักษณะเฉพาะตัว ผู้ใช้งานต่างพยายามหาค่า PUE สูง เพราะทุกวัตต์ที่ใช้ไปกับพัดลมและปั๊ม คือวัตต์ที่ไม่ได้ถูกใช้ไปกับ GPU ผมจะไม่ยกตัวเลข "ทั่วไป" มาอ้างอิง เพราะสภาพอากาศและวิธีการกำหนดขอบเขตจะเปลี่ยนแปลงไป และความแม่นยำที่ปลอมๆ นั้นแย่กว่าการไม่มีเลย น้ำก็มีส่วนเกี่ยวข้องด้วย พืชบางชนิดดูดน้ำ บางชนิดดื่มน้ำปริมาณมาก การระบายความร้อนด้วยการระเหย มีประสิทธิภาพ จนกระทั่งแม่น้ำหรือภัยแล้งทำให้มันกลายเป็นเรื่องการเมือง

การเชื่อมต่อเครือข่าย: เหตุใดโครงสร้างพื้นฐานจึงมีความสำคัญพอๆ กับชิปประมวลผล

คนส่วนใหญ่มักถ่ายรูปการ์ดจอ พวกเขาน่าจะถ่ายรูปสวิตช์ด้วย.

การฝึกฝนเปรียบเสมือนการสนทนา ตัวเร่งความเร็วหลายพันตัวแลกเปลี่ยนค่าความชัน พารามิเตอร์ และชิ้นส่วนของโมเดลอย่างแม่นยำ หากเครือข่ายเกิดความคลาดเคลื่อน งานทั้งหมดก็จะหยุดชะงักเพราะการเชื่อมต่อที่ช้าที่สุด นั่นเป็นเหตุผลที่ห้องปฏิบัติการ AI ให้ความสำคัญกับเครือข่ายที่มีแบนด์วิดท์สูง ความหน่วงต่ำ และโครงสร้างเครือข่ายที่ไม่เสียหายเมื่อการเชื่อมต่อล้มเหลว เช่น เครือข่ายแบบ InfiniBand, Ethernet ในบทบาทเดียวกัน, การเชื่อมต่อ GPU ภายในตัวเครื่อง และสายเคเบิลที่ต้องถูกต้องตั้งแต่ครั้งแรก

การอนุมานเป็นอีกเรื่องหนึ่ง การให้บริการโมเดลจะให้ความสำคัญกับความหน่วงของส่วนท้าย (tail latency) ซึ่งหมายถึงคำตอบที่ช้าที่สุด ไม่ใช่คำตอบโดยเฉลี่ย การประมวลผลแบบแบตช์กับแบบเรียลไทม์นั้นแตกต่างกันออกไป คลัสเตอร์สำหรับการฝึกอบรมต้องการ การเคลื่อนไหวที่รวดเร็วและครอบคลุม ในขณะที่กลุ่มเซิร์ฟเวอร์ต้องการคำขอขนาดเล็กจำนวนมากและการแยกส่วน โดยไม่มีปัญหาการจราจรติดขัดที่ตัวกระจายโหลด

สิ่งที่ฉันพลาดไปในขณะที่ฉันอยู่ที่นี่คือ: คนส่วนใหญ่มักมองเครือข่ายเหมือนระบบประปา และมองชิปเหมือนร้านอาหาร ในอาคารนี้ ระบบประปาคือร้านอาหาร ถ้าพลาดตรงนี้ คุณก็จะได้ครัวที่ไม่สามารถรับอาหารส่งได้.

การฝึกฝนกับการอนุมาน: สองสิ่งที่แตกต่างกันอย่างสิ้นเชิง บางครั้งก็เหมือนกันจริงๆ

การฝึกฝนระบบก็เหมือนกับการรณรงค์ คุณประกอบคลัสเตอร์ ป้อนข้อมูลเข้าไป ตรวจสอบความคืบหน้าอย่างสม่ำเสมอ รันเป็นเวลาหลายชั่วโมงหรือหลายสัปดาห์ และภาวนาให้ระบบทำงานได้อย่างราบรื่น กระบวนการนี้ใช้ทรัพยากรมาก ต้องการแบนด์วิธสูง และทำงานอย่างอดทน จนกระทั่งโหนดที่ล้มเหลวเข้ามารบกวนการทำงาน ตัวเร่งความเร็วเพียงตัวเดียวที่เสียไปในงานที่มีการเชื่อมโยงกันอย่างแน่นหนา อาจทำให้การทำงานทั้งหมดหยุดชะงักได้.

การอนุมานเปรียบเสมือนหน้าร้าน โมเดลที่ได้รับการฝึกฝนมาแล้ว กำลังตอบคำถาม จำแนกภาพ และสร้างข้อความ เวลาในการตอบสนองมีความสำคัญ ตัวเร่งความเร็วที่เก่ากว่าเล็กน้อยซึ่งอยู่ใกล้ลูกค้า อาจมีประสิทธิภาพดีกว่าตัวเร่งความเร็วที่ทันสมัยกว่าซึ่งอยู่คนละทวีป.

ดังนั้นจึงเกิดการแบ่งแยกขึ้น วิทยาเขตฝึกอบรมมุ่งเน้นไปที่พลังงาน พื้นที่ และความหนาแน่น ส่วนไซต์อนุมานมุ่งเน้นไปที่ความหน่วงแฝงและการเชื่อมต่อ ห้องโถงแบบไฮบริดก็มีอยู่เช่นกัน เพราะเงินทุนไม่ได้มีไม่จำกัด แต่ก็ไม่ใช่ว่าจะเป็นอาคารสองหลังเสมอไป บางครั้งก็เป็นห้องโถงเดียวที่มีเชือกกั้นและระบบระบายความร้อนสองชุด.

นี่คือจุดที่การให้บริการพื้นที่จัดเก็บข้อมูลร่วม (colocation), ศูนย์ข้อมูลขนาดใหญ่ (hyperscale campuses) และระบบจัดเก็บข้อมูลภายในองค์กร (on-prem) แยกออกจากกัน ผู้ให้บริการขนาดใหญ่สร้างเครือข่ายในระดับที่ทำให้พวกเราที่เหลือดูเหมือนกำลังจัดวางเฟอร์นิเจอร์อยู่ ส่วนการให้บริการพื้นที่จัดเก็บข้อมูลร่วมนั้นขายความหนาแน่นตามจำนวนแร็ค และระบบจัดเก็บข้อมูลภายในองค์กรยังคงใช้กันอยู่เมื่อข้อมูลไม่สามารถส่งออกไปได้.

อัตราการรับส่งข้อมูลของหน่วยเก็บข้อมูลจุดตรวจสอบ และชิปที่ต้องการพลังงานสูง

ไม่มีใครเอาเรื่องระบบไฟล์แบบขนานไปใส่ไว้บนหน้าปกโบรชัวร์หรอก.

ข้อมูลสำหรับการฝึกอบรมต้องมาถึงเร็วพอที่ GPU จะไม่ทำงานช้าลง การตรวจสอบความคืบหน้าต้องเสร็จสมบูรณ์เพื่อไม่ให้การขัดข้องทำให้เสียเวลาไปทั้งสัปดาห์ น้ำหนักของโมเดลต้องโหลดเสร็จก่อนที่สำเนาเซิร์ฟเวอร์จะเริ่มทำงาน ประสิทธิภาพการรับส่งข้อมูลของหน่วยเก็บข้อมูล ไม่ใช่แค่ความจุ คือคอขวดที่มองไม่เห็น คุณอาจใช้เงินจำนวนมากไปกับตัวเร่งความเร็ว แต่กลับใช้งานได้ไม่เต็มประสิทธิภาพด้วยอาร์เรย์ที่ออกแบบมาสำหรับเครื่องเสมือนอย่างสุภาพ.

รูปแบบนี้คุ้นเคยกันดี: กลุ่มเครื่องคอมพิวเตอร์ที่เปล่งประกาย คิวงาน และการรอรับส่งข้อมูลที่จ้องมองกลับมาเหมือนใบแจ้งหนี้ที่ไม่สุภาพ การจัดกลุ่มเครื่องประมวลผลโดยไม่จัดกลุ่มเส้นทางข้อมูลจะทำให้เกิดการหยุดทำงานที่สิ้นเปลืองค่าใช้จ่ายอย่างมาก จงหมั่นป้อนอาหารให้ชิปอยู่เสมอ หรือยอมรับเถอะว่าคุณซื้อประติมากรรมมาแล้ว.

ซอฟต์แวร์ การจัดการระบบ และเลเยอร์การปฏิบัติงานที่ไม่น่าดึงดูดใจนัก

ฮาร์ดแวร์คือดารา ส่วนโปรแกรมวางแผนงานต่างหากที่เป็นผู้ลงมือทำงาน.

ศูนย์ข้อมูล AI จะไร้ประโยชน์หากงานต่างๆ หา GPU ไม่ได้ หากสองทีมไม่สามารถใช้คลัสเตอร์ร่วมกันได้โดยปราศจากความขัดแย้ง หากไม่สามารถหาคนมาทดแทนส่วนที่เสียหายได้ หากเฟิร์มแวร์เกิดการเปลี่ยนแปลงจนกระทั่งระบบโดยรวมล่มสลาย การจัดการระบบ การตรวจสอบ การจำกัดพลังงาน – นี่คือส่วนงานปฏิบัติการที่ไม่น่าดึงดูดใจ แต่เป็นสิ่งที่บ่งบอกว่ามันสำคัญแค่ไหน.

ผมชอบเลเยอร์นี้เป็นพิเศษ และในกรณีที่การตั้งค่า NIC ผิดพลาดทำให้เข้าใจผิดว่าเป็นปัญหาเรื่องระบบระบายความร้อนตลอดทั้งบ่าย... คุณจะรู้ความจริงนั้นด้วยวิธีที่เจ็บปวด.

เมื่อโหนดใดโหนดหนึ่งหยุดทำงานระหว่างการทำงาน

โหนดหนึ่งเสีย ช่วงเวลาการเปลี่ยนแปลงยังคงชนกับการทำงานของโปรแกรมฝึกฝนที่ไม่ได้คำนึงถึงปฏิทินของคุณ คุณกำหนดตารางงานขนาดใหญ่แบบกลุ่ม แยกกลุ่มการประมวลผลข้อมูล เขียนคู่มือการทำงานสำหรับความล้มเหลวที่ดูเหมือนว่า "งานทำงานช้า" จนกระทั่งดูเหมือนว่า "งานนั้นล้มเหลวโดยสิ้นเชิง" ระบบสำรองยังคงมีความสำคัญ - พลังงาน การระบายความร้อน เส้นทาง พื้นที่จัดเก็บ - แต่รูปแบบความล้มเหลวนั้นไม่เรียบร้อยเท่ากับสไลด์แสดงเวลาทำงาน 9 วันแบบเดิม การประมวลผลข้อมูล: ทำสำเนา ระบายโหนดที่เสีย แล้วดำเนินการต่อไป การฝึกฝนต้องการจุดตรวจสอบ ไม่ใช่การมองโลกในแง่ดี.

ที่ตั้ง, แหล่งน้ำ, ระบบไฟฟ้า และเพื่อนบ้าน

คุณไม่ควรนำสิ่งของเหล่านี้ไปวางไว้ข้างกระท่อมเพื่อชมวิว.

การเชื่อมต่อกับโครงข่ายไฟฟ้ามักเป็นกระบวนการเลือกสถานที่ที่แท้จริงที่ดินนั้นง่ายกว่าเมื่อเทียบกับสถานีไฟฟ้าย่อยและระบบสาธารณูปโภคที่มีลูกค้ารายอื่น น้ำสำหรับทำความเย็น หากคุณใช้ ก็จะกลายเป็นปัญหาของเพื่อนบ้านทันทีที่ฝนตกหนัก เสียงรบกวน ความใหญ่โตของทัศนียภาพ ความร้อนที่รั้วกั้นเขตแดน คณะกรรมการวางผังเมืองจะค้นพบความคิดเห็นเกี่ยวกับ "ระบบคลาวด์" ในทันทีที่มันต้องการพื้นที่นาและแม่น้ำ

ความหน่วงดึงไปในทิศทางตรงกันข้าม การอนุมานชอบอยู่ใกล้ผู้ใช้และการเชื่อมต่อ การฝึกฝนสามารถซ่อนตัวอยู่ในตลาดพลังงานที่ถูกกว่าและสภาพอากาศที่เย็นกว่า อุตสาหกรรมพูดราวกับว่ามีไซต์ที่สมบูรณ์แบบเพียงแห่งเดียว แต่ความจริงแล้วไม่มี มีการประนีประนอมกันด้วยข่าวประชาสัมพันธ์.

ความร้อนที่หลงเหลืออยู่และเตาไฟที่ไม่ได้รับเชิญ

โบรชัวร์ชอบส่วนนี้มาก เช่น การส่งความร้อนที่เหลือทิ้งไปยังบ้าน สระว่ายน้ำ เรือนกระจก เป็นประโยคที่ไพเราะมาก บางครั้งระบบท่อความร้อนของเขตก็เป็นของจริง บางครั้งวิทยาเขตก็อยู่ในตำแหน่งที่ไม่เหมาะสม และความร้อนก็ยังคงลอยอยู่ในอากาศ ผมไม่ค่อยเชื่อถือเวอร์ชั่นในโบรชัวร์เท่าไหร่ แต่ผมไม่สงสัยในหลักฟิสิกส์.

ใครบ้างที่จำเป็นต้องมี (และใครบ้างที่ควรเช่าแทน)

คนส่วนใหญ่ไม่จำเป็นต้องเป็นเจ้าของห้องโถงเหล่านี้.

รายการแบบตรงไปตรงมา:

  • ไฮเปอร์สเกลเลอร์ เพราะผลิตภัณฑ์คือกลุ่มเซิร์ฟเวอร์

  • ในห้องปฏิบัติการ เมื่อเวลาในการรอคิวเป็นคอขวด หรือข้อมูลไม่สามารถส่งออกได้

  • ธนาคาร กลุ่มโรงพยาบาล หน่วยงานรัฐบาล หรือผู้ผลิตที่มีชุดข้อมูลลับ ไม่ว่าจะเก็บไว้ในระบบภายในองค์กรหรือศูนย์ข้อมูลส่วนตัว ก็อาจตัดสินใจอย่างมีเหตุผลได้ แม้ว่ากระบวนการจะยุ่งยากก็ตาม

คนอื่นๆ ควรเช่าพื้นที่เซิร์ฟเวอร์เองดีกว่า พื้นที่วางเซิร์ฟเวอร์ที่มีความหนาแน่นพร้อมสำหรับ AI การจองพื้นที่บนคลาวด์ คลัสเตอร์ที่ได้รับการจัดการ คุณจะได้รับตัวเร่งความเร็วโดยไม่ต้องกลายเป็นผู้ดูแลระบบไฟฟ้า ความโรแมนติกจะจางหายไปเมื่อมีคนถามว่าใครเป็นคนดูแลระบบระบายความร้อนตอนตี 3.

ฉันยอมรับว่ามันมีเรื่องของความภาคภูมิใจเข้ามาเกี่ยวข้อง การเป็นเจ้าของคลัสเตอร์รู้สึกเหมือนเป็นเจ้าของเครื่องมือในการทำนายผล แต่พอค่าไฟมาถึง ความภาคภูมิใจก็หายไป.

อาคารนี้สร้างขึ้นเพื่ออะไร

แล้วศูนย์ข้อมูล AI คืออะไร? มันคือศูนย์ข้อมูลเฉพาะทางที่มีความหนาแน่นสูง ซึ่งจัดระเบียบตัวเร่งความเร็ว ระบบไฟฟ้า ระบบระบายความร้อน โครงสร้างพื้นฐาน และพื้นที่จัดเก็บข้อมูล โดยคำนึงถึงโมเดลการฝึกอบรมและการให้บริการ ไม่ใช่ศูนย์ไอทีทั่วไปที่มี GPU ตั้งอยู่มุมห้อง มันดูเหมือนโกดังสินค้า และทำงานเหมือนโรงไฟฟ้าที่ใช้คณิตศาสตร์ในการคำนวณ.

ถ้าคุณจำอะไรไม่ได้เลย: ชิปต่างหากที่ได้รับชื่อเสียง ส่วนสถานีไฟฟ้าย่อย สารหล่อเย็น และเครือข่ายต่างหากที่จะเป็นตัวตัดสินว่าชิปเหล่านั้นเป็นความคิดที่ดีหรือไม่ การฝึกอบรมและการอนุมานสามารถอยู่ร่วมกันได้ แต่ก็ยังต้องการวิธีการที่แตกต่างกัน องค์กรส่วนใหญ่ควรเช่า ส่วนบางแห่งควรสร้างเอง เพื่อนบ้านจะสังเกตเห็นไม่ว่าคุณจะเลือกทางไหนก็ตาม.

ก้อนเมฆมักมีอาคารล้อมรอบเสมอ แต่ในปัจจุบัน อาคารเหล่านั้นมีความคิดเห็นเป็นของตัวเอง.

ตัวอย่างในโลกแห่งความเป็นจริง: เซลล์ฝึกอบรมแบบสองแร็ค เมื่อภาพไม่สามารถออกจากเซลล์ได้

สถานการณ์

โทมอสเป็นหัวหน้าฝ่ายโครงสร้างพื้นฐานที่ Kestrel Precision บริษัทผู้ผลิตขนาด 400 คนในเวสต์มิดแลนด์ พวกเขามีห้องปฏิบัติการภายในองค์กรขนาดเล็กอยู่แล้ว ประกอบด้วยระบบ ERP, การแชร์ไฟล์, เครื่องเสมือน (virtual machines) ซึ่งเป็นพื้นที่ใช้งานแบบผสมผสานอย่างที่บทความนี้เริ่มต้นขึ้น ระบบระบายความร้อนด้วยอากาศ อีเธอร์เน็ตแบบธรรมดา และระบบจัดเก็บข้อมูลแบบ SAN ที่เหมาะสมดีสำหรับฮาร์ดดิสก์ในสำนักงาน.

ทีมระบบวิชั่นคอมพิวเตอร์จำเป็นต้องฝึกฝนโมเดลตรวจสอบบนเครื่องกลั่นในโรงงาน เครื่องกลั่นเหล่านี้ไม่สามารถเคลื่อนย้ายออกจากสถานที่ได้ เพราะมันแสดงกระบวนการผลิตที่บริษัทจะไม่เก็บไว้ในดิสก์คลาวด์ แม้แต่ดิสก์ส่วนตัวก็ตาม วิธีแก้ปัญหาของฝ่ายจัดซื้อคือเซิร์ฟเวอร์แบบ dual-accelerator สี่เครื่องและสไลด์ที่มีชื่อว่า "ศูนย์ข้อมูล AI ของเรา" เซิร์ฟเวอร์เหล่านี้ถูกติดตั้งในแร็คที่มีอยู่แล้วสองแร็ค เนื่องจากมีพื้นที่ว่าง และพื้นที่ดูเหมือนจะเป็นข้อจำกัด.

ไม่ใช่เลย ภายในสองสัปดาห์ GPU ก็เริ่มทำงานอย่างหนัก แล้วก็ค่อยๆ ลดความเร็วลงอย่างเงียบๆ งานต่างๆ ช้าลงอย่างมากเมื่อมีการบันทึกข้อมูลลง SAN โหนดหนึ่งพังในชั่วโมงที่สิบเอ็ด และการทำงานก็...หายไปเลย โทมอสไม่ได้ล้มเหลวในการซื้อชิป เขาซื้อเวิร์กสเตชันราคาแพงจำนวนมากที่อยู่ในรหัสไปรษณีย์เดียวกัน อาคารนั้นยังคงเป็นอาคารสำนักงานสำหรับองค์กรอยู่.

พวกเขาไม่ต้องการวิทยาเขต สถานีไฟฟ้าย่อยแห่งใหม่ หรือแม่น้ำ พวกเขาต้องการเซลล์ขนาดเล็กที่ทำหน้าที่เหมือนศูนย์ข้อมูล AI ขนาดย่อม: พลังงานที่ตู้แร็คสามารถรองรับได้จริง ความร้อนที่ระบายออกโดยไม่ทำให้ชิปเสียหาย โครงสร้างพื้นฐานที่งานฝึกอบรมสามารถสื่อสารได้ พื้นที่จัดเก็บข้อมูลที่สามารถบันทึกจุดตรวจสอบ และคู่มือการใช้งานเมื่อโหนดล้มเหลว เนื่องจากภาพไม่สามารถส่งออกไปได้ การเช่าตู้โคโลเคจที่อยู่ห่างออกไปสี่สิบนาทีจึงไม่ใช่คำตอบ การปรับปรุงตู้แร็คสองตู้จึงเป็นคำตอบ.

สิ่งที่เซลล์ต้องการ

  • งบประมาณด้านพลังงานที่วัดได้บนแถวนั้น มาจาก PDU ไม่ใช่จากรายการความต้องการของ GPU หากกำลังการผลิตส่วนเกินไม่สามารถจ่ายไฟให้กับเซิร์ฟเวอร์ทั้งสี่เครื่องที่โหลดการฝึกอบรมได้ การสนทนาก็จะยุติลงตรงนั้น และพวกเขาจะพิจารณาศูนย์ข้อมูลที่หนาแน่นกว่า ไม่ใช่เรื่องมหัศจรรย์อะไร

  • ระบบระบายความร้อนของอากาศไม่เคยถูกออกแบบมาให้รองรับความหนาแน่นระดับนี้: อาจใช้เครื่องแลกเปลี่ยนความร้อนที่ประตูหลังหากห้องโถงรองรับได้ หรือใช้ระบบระบายความร้อนด้วยของเหลวขนาดเล็กหากรองรับได้เช่นกัน หากไม่มีทั้งสองอย่าง เซิร์ฟเวอร์ก็จะไม่ถูกติดตั้งที่นี่

  • ควรใช้โครงข่ายแบนด์วิดท์สูงเฉพาะระหว่างโหนดทั้งสี่ ไม่ใช่เครือข่ายอีเธอร์เน็ตของสำนักงาน หากผู้จำหน่ายมีเพียงสวิตช์ 10 Gb ในแคตตาล็อก นั่นไม่ถือว่าเป็นคลัสเตอร์

  • พื้นที่จัดเก็บข้อมูลความเร็วสูงในพื้นที่สำหรับจุดตรวจสอบและชาร์ดการฝึกอบรม ไม่ใช่ SAN ของ VM

  • ตัวกำหนดตารางเวลา ช่วงเวลาตรวจสอบ และเส้นทางการเริ่มต้นใหม่ที่เขียนไว้ ฮาร์ดแวร์คือตัวเอก ส่วนเลเยอร์นี้คืองาน

  • กล่องอนุมานที่มีรั้วกั้นสำหรับสายการผลิตในโรงงาน แยกออกจากเสียงพูดคุยในการฝึกอบรม เพราะการให้บริการต้องการความหน่วงแฝงและการแยกตัว ไม่ใช่แบบรวมหมู่

  • ได้รับอนุญาตให้บันทึกข้อมูลการใช้พลังงาน ความเร็วสัญญาณนาฬิกา GPU เหตุการณ์การลดประสิทธิภาพ และเวลาการทำงานของโปรแกรม หากพวกเขาไม่สามารถตรวจสอบข้อมูลเหล่านี้ได้ พวกเขาจะถ่ายภาพ GPU และพลาดการตรวจสอบสวิตช์

ตัวอย่างคำแนะนำ

โทมอสได้อธิบายเรื่องนี้ไว้ในเอกสารสรุปสิ่งอำนวยความสะดวกด้วยภาษาที่เข้าใจง่ายว่า:

อย่าเรียกที่นี่ว่า "วิทยาเขต AI" ให้สร้างเซลล์ฝึกอบรมแบบสองแร็คในห้องโถงที่มีอยู่แล้วสำหรับเซิร์ฟเวอร์แบบเร่งความเร็วคู่สี่เครื่อง อิมเมจจากโรงงานจะอยู่ภายในสถานที่ ความสำเร็จคือ: โหนดทั้งสี่ทำสูตรการฝึกอบรมการตรวจสอบ 12 รอบเสร็จสมบูรณ์โดยไม่เกิดปัญหาความร้อนสูงเกินไป เขียนจุดตรวจสอบในเวลาไม่กี่นาที ไม่ใช่หลายสิบนาที และดำเนินการต่อจากจุดตรวจสอบนั้นเมื่อเราทำลายแถวโดยเจตนา ระบบระบายความร้อนต้องรักษาความเร็วของ GPU ให้อยู่ในระดับการฝึกอบรม ระบบเครือข่ายต้องเป็นโครงสร้างพื้นฐานที่กล่องทั้งสี่ใช้ร่วมกัน ไม่ใช่เส้นทางผ่านกองเอกสารในสำนักงาน พื้นที่จัดเก็บข้อมูลต้องป้อนข้อมูลให้กับชิป หากเครื่องแลกเปลี่ยนความร้อนแบบติดตั้งด้านหลังประตูไม่สามารถติดตั้งได้ ให้บอกไปตรงๆ และหยุด อย่าอ้างถึงค่า PUE สำหรับสองแร็คในห้องโถงแบบผสม ตัวเลขนั้นเป็นเพียงการแสดงเท่านั้น.

จากนั้นเขาก็ใส่ข้อความนี้ลงในขั้นตอนการฝึกอบรม:

ตรวจสอบความคืบหน้าทุก 30 นาทีที่จุดตรวจสอบความเร็วสูงในพื้นที่ หากผู้เล่นคนใดเสียชีวิต ให้เริ่มต้นใหม่จากจุดตรวจสอบที่เสร็จสมบูรณ์ล่าสุด อย่ารอข้อมูลจาก SAN อย่าฝึกซ้อมต่อในขณะที่เวลาหมดลงเนื่องจากความร้อน บันทึกเวลาและหยุดเพื่อให้เราสามารถตรวจสอบความล่าช้าได้.

ชั่วโมงที่ดีจะเป็นแบบนี้: GPU ทั้งแปดตัวทำงานที่ความเร็วสัญญาณนาฬิกาสำหรับการฝึกฝน ไฟล์เช็คพอยต์ถูกบันทึกเรียบร้อยแล้ว งานยังคงทำงานไปพร้อมกันอย่างราบรื่น ชั่วโมงที่แย่จะเป็นแบบนี้: พัดลมทำงานเต็มที่ ความเร็วสัญญาณนาฬิกาลดลง ไฟล์เช็คพอยต์ถูกเขียนไปเพียง 2% หลังจากสิบนาที และมีคนในออฟฟิศพูดว่า "คลัสเตอร์ทำงานแล้ว" แต่คำว่า "ทำงานแล้ว" ไม่ได้หมายความว่ากำลังฝึกฝนอยู่.

วิธีการทดสอบ

พวกเขาเขียนแบบทดสอบก่อนการปรับปรุง ซึ่งนั่นคือประเด็นสำคัญของการไม่เชื่อถือการสาธิต.

  • สูตรเดิม 12 ยุค, ภาพนิ่งตรวจสอบ 120,000 ภาพเหมือนเดิม, ทำซ้ำ 8 ครั้ง

  • การจับเวลาจะนับจากเวลาที่สูตรเสร็จสมบูรณ์ รวมทั้งการเริ่มต้นใหม่ใดๆ โดยวัดจากเวลาที่ส่งงานจนถึงจุดตรวจสอบสุดท้ายของยุคที่ 12

  • การทดสอบเรื่องความร้อนผ่านเกณฑ์: ความเร็วสัญญาณนาฬิกาของ GPU จะคงอยู่ที่เป้าหมายการฝึกฝนตลอดการทำงาน การเกิดเหตุการณ์ลดความเร็วสัญญาณนาฬิกาถือเป็นความล้มเหลว แม้ว่างานจะเสร็จสมบูรณ์ในที่สุดก็ตาม

  • ผลการทดสอบการจัดเก็บข้อมูล: เวลาในการเขียนจุดตรวจสอบ ค่ามัธยฐาน และค่าที่แย่ที่สุด จากบันทึกการทำงาน

  • การส่งต่อผ้า: งานจะไม่ถูกปล่อยให้รอรวมกันตราบใดที่แถวยังแข็งแรงดีอยู่ ถ้าพวกเขาไม่เห็นการรอคอยนั้น แสดงว่าเครื่องมือยังไม่เสร็จ

  • ในจำนวน 8 รอบ มี 2 รอบที่ผู้เล่นคนหนึ่งถูกกำจัดออกจากการแข่งขันในขั้นตอนที่กำหนดไว้โดยเจตนา เพื่อทดสอบเส้นทางการเริ่มต้นใหม่

  • การอนุมานเป็นการทดสอบภาพ 200 ภาพแยกต่างหาก ตั้งแต่สายการผลิตในโรงงานไปจนถึงกล่องเสิร์ฟที่มีรั้วกั้น ความสำเร็จในการฝึกฝนไม่นับรวมเป็นความสำเร็จในการเสิร์ฟ

  • พวกเขาบันทึกกำลังไฟจาก PDU ของแร็คเป็นช่วงเวลา 15 นาที ดังนั้นจึงไม่มีใครต้องคิดค้นหน่วยเมกะวัตต์ขึ้นมาเอง

การยอมรับสำหรับการเรียกเซลล์ว่า "พร้อมใช้งาน AI": สูตรอาหาร 8 จาก 8 สูตรเสร็จสมบูรณ์; 0 จาก 8 แสดงการลดประสิทธิภาพเนื่องจากความร้อนสูง; การทำงานที่ถูกยกเลิกทั้งสองครั้งกลับมาทำงานต่อ; จุดตรวจสอบยังคงอยู่ในหน่วยนาที หากพวกเขาพลาดในส่วนนี้ พวกเขายังมีห้องเซิร์ฟเวอร์ที่มีการ์ดกราฟิกสุดหรูอยู่.

ผลลัพธ์

ผลลัพธ์ที่แสดงนี้เป็นเพียงตัวอย่าง จากการทดสอบจำลอง 8 รอบ ไม่ใช่ตัวเลขที่เผยแพร่อย่างเป็นทางการจาก Kestrel.

ข้อสมมติฐาน: เซิร์ฟเวอร์แบบเร่งความเร็วคู่สี่เครื่องในสองแร็ค; โมเดลการตรวจสอบหนึ่งแบบ; ภาพนิ่ง 120,000 ภาพ; การทำงานแปดรอบของสูตรคงที่ 12 รอบ; เวลาจริงรวมถึงการเริ่มต้นใหม่จนกว่าสูตรจะเสร็จสิ้น; การลดความเร็วหมายถึงการบันทึกการลดลงของนาฬิกาฝึกอบรม; เวลาจุดตรวจสอบคือเวลาที่เขียน ไม่ใช่เวลาที่ต้องการ; กำลังไฟของแร็คคือตัวอย่าง PDU ไม่ใช่ PUE ของวิทยาเขต.

ก่อนการปรับปรุงระบบ GPU ในแร็คระบายความร้อนด้วยอากาศทั่วไป เชื่อมต่อกับอีเธอร์เน็ตในสำนักงาน และ VM SAN:

  • จากการวิ่งทั้งหมด 8 ครั้ง มี 5 ครั้งที่จบในการลองครั้งแรก เวลาเฉลี่ยในการวิ่งทั้ง 5 ครั้งนั้นคือ 14 ชั่วโมง

  • 3 ใน 8 เครื่องต้องเริ่มต้นใหม่หลังจากหยุดชะงักไปประมาณชั่วโมงที่ 11 (สองเครื่องหลังจากโหนดเสียโดยมีจุดตรวจสอบที่ล้าสมัย หนึ่งเครื่องหลังจากจุดตรวจสอบเต็ม SAN) มีการลองใหม่ทันทีโดยไม่ต้องรอข้ามคืน: เสียเวลาไป 11 ชั่วโมง บวกกับการลองครั้งที่สองอีก 14 ชั่วโมง หรือรวมเป็น 25 ชั่วโมงกว่าจะได้สูตรสำเร็จในสามเครื่องนั้น

  • เวลาเฉลี่ยที่ใช้ในการทำอาหารจนเสร็จสมบูรณ์ทั้ง 8 สูตร โดยรวมเวลาที่ต้องเริ่มใหม่แล้ว คือ 18 ชั่วโมง (5 สูตรใช้เวลา 14 ชั่วโมง และ 3 สูตรใช้เวลา 25 ชั่วโมง ค่ามัธยฐานของทั้ง 8 สูตรยังคงอยู่ที่ 14 ชั่วโมง ซึ่งจะซ่อนเวลาที่ต้องเริ่มใหม่ ดังนั้นจึงใช้ค่าเฉลี่ยเป็นค่าอ้างอิงในที่นี้)

  • ตรวจพบการลดความเร็วเนื่องจากความร้อนสูงเกินไปใน 7 จาก 8 ครั้งของการทดสอบ เวลาเฉลี่ยที่ความเร็วสัญญาณนาฬิกาลดลง: 3 ชั่วโมง ในการทดสอบ 14 ชั่วโมง

  • การเขียนจุดตรวจสอบ: ค่ามัธยฐาน 22 นาที

  • การสังหารตามลำดับชั้นไม่ใช่บททดสอบที่พวกเขาจะผ่านได้ พวกเขาไม่มีคู่มือปฏิบัติการ การเสียชีวิตโดยอุบัติเหตุสองครั้งเป็นสิ่งที่ค้นพบ

  • โหลดสูงสุดของอุปกรณ์ไอทีบนแร็คทั้งสองระหว่างการฝึกซ้อม: ประมาณ 18 กิโลวัตต์ แถวนั้นมีกำลังวัตต์ แต่ไม่มีระบบระบายความร้อนหรือวัสดุหุ้ม

หลังจากติดตั้งเครื่องแลกเปลี่ยนความร้อนที่ประตูหลังบนแร็คทั้งสองแล้ว จะมีโครงข่ายเฉพาะเชื่อมระหว่างโหนดทั้งสี่ พูล NVMe ขนาดเล็กสำหรับจุดตรวจสอบ การตรวจสอบจุดทุก 30 นาที และคู่มือการเริ่มต้นใหม่:

  • สำเร็จ 8 จาก 8 ครั้งในการลองครั้งแรก เวลาเฉลี่ยที่ใช้: 9 ชั่วโมง

  • การลดกำลังเนื่องจากความร้อน: 0 จาก 8

  • การเขียนข้อมูลลงในจุดตรวจสอบ: ค่ามัธยฐาน 90 วินาที เวลาที่แย่ที่สุดในชุดทดสอบ: 3 นาที

  • การสังหารศัตรูโดยเจตนาทั้งสองครั้งเริ่มต้นต่อจากจุดตรวจสอบ 30 นาทีสุดท้าย เวลาที่ใช้เพิ่มขึ้นในการเล่นสองครั้งนี้: ประมาณ 40 นาทีต่อครั้ง รวมเวลาวิเคราะห์แล้ว ดังนั้นเวลารวมจึงอยู่ที่ประมาณ 9 ชั่วโมง 40 นาที ค่าเฉลี่ยจากการเล่นแปดรอบนิ่งอยู่ที่ 9 ชั่วโมง

  • โหลดสูงสุดของระบบไอทียังคงอยู่ที่ประมาณ 18 กิโลวัตต์ ใช้ชิปตัวเดิม แต่ลักษณะของอาคารแตกต่างกัน

จากตัวอย่างนี้ เวลาเฉลี่ยในการผลิตสูตรอาหารเสร็จสมบูรณ์ลดลงจาก 18 ชั่วโมงเหลือ 9 ชั่วโมง หรือ 9 ชั่วโมงต่อครั้ง รวมเป็น 72 ชั่วโมงในการทดลอง 8 ครั้ง อัตราการผลิตเสร็จในครั้งแรกเพิ่มขึ้นจาก 5 ใน 8 ครั้ง เป็น 8 ใน 8 ครั้ง อัตราการใช้คันเร่งลดลงจาก 7 ใน 8 ครั้ง เหลือ 0 ใน 8 ครั้ง ตัวเลขสุดท้ายนี้บ่งบอกว่าพวกเขาซื้อตัวเร่งความเร็วหรือที่ทับกระดาษกันแน่ พวกเขาคงไม่เรียกการเปลี่ยนแปลงเวลาครั้งนี้ว่าเป็นการประหยัดต้นทุนการผลิต 50% การทดลอง 8 ครั้งเป็นชุดตัวอย่างเล็ก ๆ ที่ทำได้ง่าย.

ตัวเลขเหล่านี้เป็นเพียงตัวอย่างประมาณการโดยอิงจากการทดสอบที่ระบุไว้ ตัวอย่างขนาดเล็ก แบบจำลองเดียว และห้องผสมเพียงห้องเดียว ไม่ใช่ค่า PUE ไม่ใช่เมกะวัตต์ของวิทยาเขต และไม่ใช่หลักฐานที่แสดงว่า Kestrel ควรสร้างสถานที่ฝึกอบรมในพื้นที่จริง การตรวจสอบบันทึกเกิดขึ้นภายใน 9 ชั่วโมง พวกเขาไม่ได้ปกปิดข้อมูล ตัวเลข 18 กิโลวัตต์เป็นค่าที่ปัดเศษจากการอ่านค่า PDU ไม่ใช่ใบแจ้งหนี้ค่าไฟฟ้า พวกเขาไม่ได้แปลง 72 ชั่วโมงเป็นต้นทุน เพราะอัตราค่าไฟฟ้าแบบผสมของโรงงานจะทำให้กรณีศึกษาทางธุรกิจไม่สมจริง.

การตรวจสอบการเสิร์ฟนั้นแยกต่างหากและมีขนาดเล็กกว่า: ภาพเส้น 200 ภาพไปยังกรอบที่ล้อมรั้วไว้ ทั้งหมดอยู่ในสถานที่นั้น นั่นคือการอนุมาน ไม่ใช่การฝึกฝน การผสมผสานทั้งสองอย่างเข้าด้วยกันจะเป็นความผิดพลาดแบบไฮบริดฮอลล์ในขนาดเล็ก.

อะไรบ้างที่อาจผิดพลาดได้

  • ฝ่ายจัดซื้อยังคงเรียกเซิร์ฟเวอร์สี่เครื่องนั้นว่า "ศูนย์ข้อมูล AI" ป้ายชื่อนั้นซ่อนระบบท่อภายในไว้ และการจัดซื้อครั้งต่อไปก็คือการ์ดจอเพิ่มสำหรับชั้นวางสินค้าที่ดูไม่ค่อยดีนักในที่เดิม

  • เครื่องแลกเปลี่ยนความร้อนด้านหลังประตูถูกติดตั้งเข้าไป แต่ไม่มีใครสั่งการให้ระบบน้ำทำงาน แฟนๆ ยังคงส่งเสียงเชียร์ นาฬิกายังคงเดินช้าลง

  • โครงข่ายประกอบด้วยสวิตช์ตัวเดียวที่ไม่มีเส้นทางสำรอง หากลิงก์ใดลิงก์หนึ่งล้มเหลว "คลัสเตอร์" ก็จะเหลือเวิร์กสเตชันเพียงสี่เครื่องอีกครั้ง

  • จุดตรวจสอบยังคงอยู่บน SAN เนื่องจากพูล NVMe อยู่ใน "เฟสสอง" เฟสสองจะไม่เกิดขึ้นจนกว่าโหนดถัดไปจะเสีย

  • พวกเขาระบุค่า PUE สำหรับชั้นวางสองชั้นในห้องโถงรวม สภาพอากาศ ขอบเขต และส่วนอื่นๆ ของแถว ERP ทำให้ค่าอัตราส่วนนั้นเป็นเพียงค่าประมาณ

  • การฝึกอบรมและการให้บริการล้วนมีพื้นฐานเดียวกัน การที่จุดตรวจเต็มไปด้วยสินค้าทำให้สายการผลิตในโรงงานต้องหยุดชะงัก ความล่าช้าที่เกิดขึ้นคือผลลัพธ์ของกระบวนการ ไม่ใช่ความหนาแน่น

  • โหนดหนึ่งเสีย และมีคนจัดการมันเหมือนกับตั๋วแจ้งปัญหาเรื่องความพร้อมใช้งาน แทนที่จะเป็นการรีสตาร์ทจากจุดตรวจสอบ ฝ่ายปฏิบัติการระดับองค์กรและฝ่ายปฏิบัติการ AI คุยกันไม่เข้าใจกันตลอดทั้งบ่าย

  • พวกเขาอาจจะเช่ากรงได้ แต่ภาพเหล่านั้นออกไปไม่ได้ การลืมข้อจำกัดนั้นทำให้พวกเขาเข้าสู่บทสนทนาบนคลาวด์ที่พวกเขาจะต้องคลี่คลายในภายหลัง

ข้อคิดที่นำไปใช้ได้จริง

ศูนย์ข้อมูล AI ในรูปทรงนี้ ไม่ใช่โกดังเก็บสินค้า และไม่ใช่ใบแจ้งหนี้ GPU มันคือเซลล์ที่ช่วยให้ตัวเร่งความเร็วทำงานให้เสร็จสิ้น: พลังงานที่พวกมันสามารถรับได้ ความร้อนที่ระบายออก โครงสร้าง จุดตรวจสอบ และผู้รับผิดชอบเมื่อเกิดปัญหาขึ้น Kestrel ไม่จำเป็นต้องมีพื้นที่ขนาดใหญ่ พวกเขาต้องการเพียงสองชั้นเพื่อหยุดการเสแสร้ง ทีมส่วนใหญ่ควรเช่าพฤติกรรมนั้น ทีมเพียงไม่กี่ทีมที่มีชุดข้อมูลลับและห้องโถงที่ทนความร้อนได้ ควรสร้างเซลล์และปฏิเสธการเปลี่ยนแปลง.

คำถามที่พบบ่อย

ศูนย์ข้อมูล AI คืออะไร?

ศูนย์ประมวลผลความหนาแน่นสูง ที่ซึ่งพลังงาน การระบายความร้อน เครือข่าย และพื้นที่จัดเก็บข้อมูล ถูกออกแบบมาเพื่อรองรับการฝึกฝนและการให้บริการโมเดลแบบขนาน ไม่ใช่การจัดเรียงเซิร์ฟเวอร์ทั่วไปอย่างเป็นระเบียบ มันถูกออกแบบมาเพื่อให้ตัวเร่งความเร็วจำนวนมหาศาลสามารถฝึกฝนและให้บริการโมเดลได้โดยไม่เกิดปัญหาเครื่องร้อนเกินไป ติดขัดบนเครือข่าย หรือรอการประมวลผลจากดิสก์ ห้องประมวลผลแบบทั่วไปนั้นเปรียบเสมือนย่านที่มีอุปกรณ์หลากหลาย แต่ห้องประมวลผล AI นั้นเปรียบเสมือนสวนพืชผลชนิดเดียวที่มีหน่วยวัดมูลค่าเป็นตัวเร่งความเร็ว เช่น GPU หรือชิปแบบ TPU มันดูเหมือนโกดังสินค้า แต่ทำงานเหมือนโรงไฟฟ้าที่ทำการคำนวณทางคณิตศาสตร์.

ศูนย์ข้อมูล AI แตกต่างจากศูนย์ข้อมูลทั่วไปอย่างไร?

ศูนย์ข้อมูลแบบดั้งเดิมได้รับการออกแบบมาเพื่อรองรับปริมาณงานที่หลากหลายและรักษาความเสถียรของระบบสำหรับบริการขนาดเล็กจำนวนมาก แต่ศูนย์ข้อมูล AI กลับพลิกอัตราส่วนนี้: ความหนาแน่นเพิ่มขึ้น เครือข่ายกลายเป็นโครงสร้างพื้นฐานที่งานฝึกอบรมขาดไม่ได้ และพื้นที่จัดเก็บข้อมูลต้องคอยอัปเดตจุดตรวจสอบอยู่เสมอ มิฉะนั้นตัวเร่งความเร็วก็จะไม่ได้ใช้งาน ฝ่ายปฏิบัติการขององค์กรคิดในแง่ของตั๋วและช่วงเวลาการเปลี่ยนแปลง ส่วนฝ่ายปฏิบัติการ AI คิดในแง่ของคิวงานและความรู้สึกแย่ๆ เมื่อโหนดใดโหนดหนึ่งล้มเหลวในช่วงท้ายของการทำงานระยะยาว คุณยังสามารถเรียกทั้งสองอย่างว่าศูนย์ข้อมูลได้ เพียงแต่ชื่อเรียกนั้นซ่อนกลไกการทำงานภายในเอาไว้เท่านั้น.

เหตุใดศูนย์ข้อมูล AI จึงใช้พลังงานมากขนาดนี้?

ฮาร์ดแวร์ที่โดดเด่นไม่ใช่ซีพียูอัจฉริยะ แต่เป็นถาดเร่งความเร็ว: จีพียูหรือชิป AI อื่นๆ ที่บรรจุอยู่ในเซิร์ฟเวอร์ จากนั้นก็ใส่ในแร็ค แล้วก็เรียงเป็นแถวๆ ที่ใช้โครงสร้างพื้นฐานแบนด์วิดท์สูงร่วมกัน ความหนาแน่นต่อแร็คคือจุดพลิกผัน: แร็คน้อยลง แต่ละแร็คเปรียบเสมือนเตาหลอมขนาดเล็ก กำลังไฟฟ้ามหาศาลระดับเมกะวัตต์จะปรากฏขึ้นเมื่อห้องโถงเต็มไปด้วยอุปกรณ์ แม้ว่าการกำหนดตัวเลขทั่วไปจะไม่คุ้มค่าก็ตาม ปัจจัยจำกัดมักอยู่ที่สถานีจ่ายไฟ ไม่ใช่รายการจีพียูที่ต้องการ.

ศูนย์ข้อมูล AI ใช้ระบบระบายความร้อนอย่างไร?

แร็คที่มีความหนาแน่นสูงระบายความร้อนในแบบที่อากาศไม่เคยถูกออกแบบมาให้รับมือได้ คุณสามารถเพิ่มประสิทธิภาพการระบายความร้อนด้วยอากาศได้ด้วยตัวแลกเปลี่ยนความร้อนที่ประตูหลัง ทางเดินที่ร้อนกว่า และการกักเก็บความร้อนอย่างชาญฉลาด จากนั้นของเหลวก็เข้ามามีบทบาท: การระบายความร้อนโดยตรงไปยังชิป วงจรระบายความร้อน และการแช่ในบางแบบ ตัวเร่งความเร็วที่ลดประสิทธิภาพลงคือสิ่งที่คุณจ่ายเงินไปแล้วแต่ไม่สามารถใช้งานได้อย่างเต็มที่ ค่า PUE ยังคงมีความสำคัญ เพราะทุกวัตต์ที่ใช้ไปกับพัดลมและปั๊ม คือวัตต์ที่ไม่ได้ไปที่ GPU น้ำก็มีบทบาทในเรื่องนี้เช่นกัน: พืชบางชนิดดูดน้ำ บางชนิดดื่มน้ำปริมาณมาก.

เหตุใดการเชื่อมต่อเครือข่ายจึงมีความสำคัญเท่ากับ GPU?

การฝึกฝนเปรียบเสมือนการสนทนา: ตัวเร่งความเร็วหลายพันตัวแลกเปลี่ยนค่าความชัน พารามิเตอร์ และส่วนย่อยของโมเดลอย่างแม่นยำ หากโครงสร้างเครือข่ายสั่นคลอน งานทั้งหมดก็จะหยุดรออยู่ที่จุดที่ช้าที่สุด นั่นเป็นเหตุผลที่ห้องปฏิบัติการ AI ให้ความสำคัญกับเครือข่ายที่มีแบนด์วิดท์สูง ความหน่วงต่ำ โครงสร้างเครือข่ายแบบ InfiniBand หรือ Ethernet และโครงสร้างเครือข่ายที่ไม่ล่มเมื่อลิงก์ล้มเหลว การอนุมานนั้นให้ความสำคัญกับความหน่วงที่จุดสิ้นสุด คำขอขนาดเล็กจำนวนมาก และการแยกส่วน ในอาคารนี้ ระบบท่อประปาเปรียบเสมือนร้านอาหาร.

ศูนย์ข้อมูล AI ใช้สำหรับอะไร: การฝึกฝนหรือการอนุมาน?

การฝึกฝนเปรียบเสมือนแคมเปญ: รวบรวมกลุ่มคอมพิวเตอร์ ป้อนข้อมูล ตรวจสอบความคืบหน้าอย่างสม่ำเสมอ และรันเป็นเวลาหลายชั่วโมงหรือหลายสัปดาห์ ส่วนการอนุมานเปรียบเสมือนหน้าร้าน: โมเดลที่ได้รับการฝึกฝนมาแล้ว พร้อมที่จะตอบคำถาม โดยมีเวลาแฝงที่สำคัญ ศูนย์ฝึกฝนมุ่งเน้นไปที่พลังงาน พื้นที่ และความหนาแน่น ส่วนไซต์การอนุมานมุ่งเน้นไปที่เวลาแฝงและการมีอยู่ ห้องประมวลผลแบบไฮบริดมีอยู่เพราะเงินทุนไม่ได้มีอยู่อย่างไม่จำกัด บางครั้งอาจมีห้องประมวลผลเพียงห้องเดียวที่มีวงจรระบายความร้อนสองวงจร เครื่องเร่งอนุภาคที่เก่ากว่าเล็กน้อยซึ่งอยู่ใกล้ลูกค้าอาจมีประสิทธิภาพดีกว่าเครื่องเร่งอนุภาคที่ทันสมัยกว่าซึ่งอยู่คนละทวีป.

เหตุใดการจัดเก็บข้อมูลจึงมีความสำคัญในศูนย์ข้อมูล AI?

ข้อมูลสำหรับการฝึกอบรมต้องมาถึงเร็วพอที่ GPU จะไม่ทำงานช้าลง การตรวจสอบความคืบหน้าต้องเสร็จสมบูรณ์เพื่อไม่ให้การขัดข้องทำให้เสียเวลาไปทั้งสัปดาห์ น้ำหนักของโมเดลต้องโหลดเสร็จก่อนที่สำเนาเซิร์ฟเวอร์จะเริ่มทำงาน ประสิทธิภาพการรับส่งข้อมูลของหน่วยเก็บข้อมูล ไม่ใช่แค่ความจุ คือคอขวดที่มองไม่เห็น คุณอาจใช้เงินจำนวนมากไปกับตัวเร่งความเร็ว แต่กลับใช้งานได้ไม่เต็มประสิทธิภาพด้วยอาร์เรย์ที่ออกแบบมาสำหรับเครื่องเสมือนอย่างสุภาพ.

จะเกิดอะไรขึ้นเมื่อโหนดใดโหนดหนึ่งหยุดทำงานระหว่างการทำงาน?

ตัวเร่งความเร็วตัวใดตัวหนึ่งที่เสียไปในงานฝึกอบรมที่เชื่อมโยงกันอย่างแน่นหนา อาจทำให้กระบวนการทั้งหมดหยุดชะงักได้ การฝึกอบรมต้องการจุดตรวจสอบ ไม่ใช่การมองโลกในแง่ดี การอนุมานจะระบายโหนดที่เสียออกไป รักษาโหนดสำรองให้ตอบสนอง และคงการทำงานต่อไป ช่วงเวลาการเปลี่ยนแปลงยังคงชนกับการทำงานของการฝึกอบรมที่ไม่สนใจปฏิทินของคุณ ความซ้ำซ้อนยังคงมีความสำคัญสำหรับพลังงาน การระบายความร้อน เส้นทาง และพื้นที่จัดเก็บ แต่รูปแบบความล้มเหลวนั้นไม่เรียบร้อยเท่ากับสไลด์การทำงานต่อเนื่องเก้าวันแบบเก่า.

ศูนย์ข้อมูล AI ส่งผลกระทบต่อระบบไฟฟ้า น้ำ และพื้นที่ใกล้เคียงอย่างไร?

การเชื่อมต่อกับโครงข่ายไฟฟ้ามักเป็นกระบวนการเลือกสถานที่ที่แท้จริง ที่ดินนั้นง่ายกว่าเมื่อเทียบกับสถานีไฟฟ้าย่อยและบริษัทสาธารณูปโภคที่มีลูกค้ารายอื่น น้ำสำหรับทำความเย็น หากคุณใช้ ก็จะกลายเป็นปัญหาของเพื่อนบ้านทันทีที่ฝนตกหนัก พร้อมกับเสียงรบกวน ความใหญ่โตของสิ่งปลูกสร้าง และความร้อนบริเวณรั้วบ้าน การฝึกอบรมสามารถซ่อนตัวอยู่ในตลาดพลังงานที่ถูกกว่าและสภาพอากาศที่เย็นกว่าได้ การอนุมานชอบที่จะอยู่ใกล้กับผู้ใช้งาน ไม่มีสถานที่ใดที่สมบูรณ์แบบ มีการประนีประนอมกับข่าวประชาสัมพันธ์.

ฉันจำเป็นต้องเป็นเจ้าของศูนย์ข้อมูล AI หรือควรเช่าดี?

คนส่วนใหญ่ไม่จำเป็นต้องเป็นเจ้าของห้องเซิร์ฟเวอร์เหล่านี้ ผู้ให้บริการคลาวด์ขนาดใหญ่สร้างเพราะผลิตภัณฑ์ของพวกเขาคือกลุ่มเซิร์ฟเวอร์ ห้องปฏิบัติการสร้างเมื่อเวลาในการรอคิวเป็นคอขวดหรือข้อมูลไม่สามารถส่งออกได้ ธนาคาร โรงพยาบาล รัฐบาล หรือผู้ผลิตที่มีชุดข้อมูลลับ อาจเลือกใช้เซิร์ฟเวอร์ภายในองค์กรหรือเซิร์ฟเวอร์โคโลเคชั่นส่วนตัว ส่วนคนอื่นๆ ควรเช่า: โคโลเคชั่นที่พร้อมสำหรับ AI, การจองคลาวด์ หรือคลัสเตอร์แบบจัดการ คุณจะได้รับตัวเร่งความเร็วโดยไม่ต้องกลายเป็นผู้ดำเนินการโรงไฟฟ้า.

เอกสารอ้างอิง

  1. IEA - www.iea.org

  2. LBNL - datacenters.lbl.gov

  3. เดอะกรีนกริด - www.thegreengrid.org

  4. LBNL - datacenters.lbl.gov

  5. LBNL - datacenters.lbl.gov

  6. Uptime Institute - journal.uptimeinstitute.com

  7. NVIDIA - developer.nvidia.com

  8. NVIDIA - docs.nvidia.com

  9. NVIDIA - docs.nvidia.com

  10. NVIDIA - docs.nvidia.com

  11. Google Cloud - docs.cloud.google.com

ค้นหา AI รุ่นล่าสุดได้ที่ร้านค้าผู้ช่วย AI อย่างเป็นทางการ

เกี่ยวกับเรา

แบบทดสอบ
1. จากบทความแล้ว ศูนย์ข้อมูล AI คืออะไร?

2. ในกรณีที่ไม่ใช่พระราชวัง แต่เป็นสถานที่จริง ทีมอย่าง Kestrel ควรทำอย่างไรเมื่อไม่สามารถส่งออกอิมเมจจากโรงงานได้?

3. เหตุใดบทความจึงใช้ค่าเฉลี่ย 18 ชั่วโมง แทนที่จะใช้ค่ามัธยฐาน 14 ชั่วโมง เป็นค่าพื้นฐานก่อนการปรับปรุงแก้ไข?

4. หลังจากทำการปรับปรุงแร็คสองตัวในการทดสอบแปดรอบตัวอย่างแล้ว อะไรเปลี่ยนแปลงไปบ้าง?

5. บทความกล่าวถึงการอ้างอิงค่า PUE สำหรับเซลล์แบบสองแร็คนี้อย่างไรบ้าง?


กลับไปที่บล็อก