टूल
गाइड

AI कंप्यूट संदर्भ

संदर्भ

AI त्वरक थ्रूपुट (FLOPS/TOPS), परिशुद्धता प्रारूप, और कंप्यूट इकाई परिभाषाएँ।

100% क्लाइंट-साइड कोई बैकएंड नहीं

कंप्यूट इकाइयाँ

परिशुद्धता प्रारूप

त्वरक प्रकार

हार्डवेयर

नाम विक्रेता आर्किटेक्चर मेमोरी बैंडविड्थ FP16/BF16 (TF) FP8 (TF) INT8 (TOPS)

ये मान विक्रेता डेटाशीट से सैद्धांतिक शिखर (dense) हैं। वास्तविक निरंतर थ्रूपुट निम्न होता है और प्रशिक्षण तथा अनुमान में भिन्न होता है। FLOPS और TOPS भिन्न संक्रियाएँ मापते हैं और सीधे तुलनीय नहीं हैं।

इस पृष्ठ पर

AI कंप्यूट हार्डवेयर संदर्भ क्या है?#

जब आप पढ़ते हैं कि कोई GPU “1979 TFLOPS” देता है या किसी चिप में “192 GB मेमोरी” है, तो वे संख्याएँ तभी कुछ अर्थ रखती हैं जब आप उनके पीछे के नियम जानें: वह संख्यात्मक परिशुद्धता जिस पर आंकड़ा मापा गया, क्या इसमें संरचित sparsity शामिल है, क्या यह फ़्लोटिंग-पॉइंट थ्रूपुट (TFLOPS) है या पूर्णांक थ्रूपुट (TOPS), और मेमोरी वास्तव में कौन-सा बैंडविड्थ देती है। विक्रेता शीर्षक संख्याएँ अपने सबसे अनुकूल विन्यास में प्रकाशित करते हैं; एक ऐसे संदर्भ के बिना जो स्थितियाँ बताता है, दो चिप्स को ईमानदारी से तुलना नहीं किया जा सकता।

यह पृष्ठ वह संदर्भ है। यह चार चीज़ें एक साथ इकट्ठा करता है जो एक ML इंजीनियर या ढाँचा-खरीदार को वास्तव में चाहिए: कंप्यूट-इकाई शब्दावली (FLOPS, TFLOPS, TOPS, और MAC वास्तव में क्या हैं), संख्यात्मक परिशुद्धता प्रारूप (FP64 से INT4 तक, सामान्य थ्रूपुट क्रम में), त्वरक प्रकार (CPU, GPU, TPU, NPU, LPU, MAU), और विशिष्ट चिप्स की एक हार्डवेयर तालिका उनकी मेमोरी क्षमता, मेमोरी बैंडविड्थ, और FP16, FP8, और INT8 पर dense शिखर थ्रूपुट के साथ — हर आंकड़ा विक्रेता डेटाशीट के विरुद्ध सत्यापित, एक कैविएट नोट के साथ जब कोई संख्या भ्रामक हो सकती है।

इसका उपयोग कैसे करें#

  1. सब कुछ में खोजें। शीर्ष पर एकल खोजें बॉक्स नाम, विक्रेता, प्रोसेस नोड, या स्पेक द्वारा सभी चार खंड एक साथ फ़िल्टर करता है — H100, NVIDIA, 192gb, या 4.8tb/s टाइप करना हार्डवेयर तालिका को संकरा करता है।
  2. चार खंड पढ़ें।
    • कंप्यूट इकाइयाँ — SI-उपसर्गित प्रतीक (FLOP से EFLOPS तक, साथ में TOPS और MAC) उनके base-10 घातांकों सहित, ताकि आप उनके बीच रूपांतरण कर सकें।
    • परिशुद्धता प्रारूप — FP64, FP32, TF32, FP16, BF16, FP8, INT8, INT4, प्रत्येक अपनी बिट चौड़ाई और सामान्य उपयोग मामले के साथ, मोटे तौर पर आधुनिक tensor core पर बढ़ते थ्रूपुट के क्रम में।
    • त्वरक प्रकार — CPU, GPU, TPU, NPU, LPU, और MAU के बीच एक-पंक्ति का अंतर।
    • हार्डवेयर तालिका — नाम, विक्रेता, आर्किटेक्चर, मेमोरी (GB), मेमोरी बैंडविड्थ (TB/s), और dense FP16 / FP8 / INT8 थ्रूपुट, प्रति-चिप कैविएट नोट के साथ।
  3. रिक्त स्थान पर भरोसा करें। जहाँ कोई सेल शून्य के बजाय रिक्त है, वहाँ आंकड़ा dense शिखर के रूप में सत्यापित नहीं हो सका — नोट समझाता है कि क्यों (AMD का MI300X sparse शिखर प्रकाशित करता है, इसलिए dense लगभग आधा है)। रिक्त छोड़ना किसी छिपी शर्त वाली संख्या छापने से अधिक ईमानदार है।

मुख्य विशेषताएँ#

  • केवल dense शिखर, sparsity कॉलआउट के साथ। NVIDIA आंकड़े dense हैं (2:4 संरचित sparsity रहित); नोट आपको याद दिलाता है कि उनकी शीर्षक विपणन संख्याएँ अक्सर sparsity चालू होने पर दोगुनी हो जाती हैं। कोई चुपचाप “with sparsity” फुलावा नहीं।
  • TFLOPS और TOPS अलग रखे। शब्दावली स्पष्ट रूप से कहती है कि TOPS (OPS परिवार) TFLOPS (FLOPS परिवार) के सीधे तौर पर तुलनीय नहीं है — एक भ्रम जिसका फ़ायदा विक्रेता खुशी-खुशी उठाते हैं।
  • थ्रूपुट क्रम में सभी चार परिशुद्धताएँ। एक नज़र में देखें कि FP8 लगभग FP16 को दोगुना करता है, और INT8 लगभग BF16 को दोगुना करता है, किसी दिए गए आर्किटेक्चर पर — वह आर्थिक कारण जिसके लिए quantization मौजूद है।
  • मेमोरी और बैंडविड्थ, केवल कंप्यूट नहीं। बड़े-भाषा-मॉडल अनुमान हेतु, मेमोरी क्षमता और बैंडविड्थ अक्सर शिखर FLOPS से अधिक मायने रखते हैं, इसलिए वे प्रथम-श्रेणी कॉलम हैं।
  • स्रोत नाम से उद्धृत, लिंक से नहीं। हर आंकड़ा वह डेटाशीट या उत्पाद पृष्ठ नाम देता है जहाँ से आया, कोई बाहर जाने वाला URL नहीं, ताकि आप विक्रेता के अपने प्रलेखन के विरुद्ध सत्यापित कर सकें।

विस्तृत उदाहरण#

हार्डवेयर तालिका का उपयोग करके तीन पीढ़ियों में NVIDIA लाइन की तुलना करें। NVIDIA खोजें और आपको A100, H100, और H200 पंक्तियाँ एक साथ मिलती हैं:

चिपमेमोरीबैंडविड्थFP16 denseFP8 denseINT8 dense
A100 80GB SXM80 GB2.0 TB/s312 TFLOPS—624 TOPS
H100 SXM580 GB3.35 TB/s989 TFLOPS1979 TFLOPS1979 TOPS
H200 SXM141 GB4.8 TB/s989 TFLOPS1979 TFLOPS1979 TOPS

दो बातें उभरती हैं। पहला, H100 से H200 की छलांग ने कोई कंप्यूट नहीं जोड़ा — दोनों एक ही GH100 कंप्यूट डाई साझा करते हैं; H200 एक मेमोरी रिफ़्रेश है HBM3e पर, क्षमता (80 → 141 GB) और बैंडविड्थ (3.35 → 4.8 TB/s) को लगभग दोगुना करता है। किसी मेमोरी-बाउंड LLM अनुमान कार्यभार हेतु, वह अधिक FLOPS से बड़ा वास्तविक-विश्व लाभ है। दूसरा, A100 का कोई FP8 कॉलम नहीं — FP8 एक Hopper-पीढ़ी सुविधा है, इसलिए पूर्व-Hopper चिप्स में यह बस नहीं है।

फिर AMD और Google पंक्तियाँ निकालें। MI300X सूचीबद्ध किसी भी चिप की सबसे बड़ी मेमोरी (192 GB) और बैंडविड्थ (5.3 TB/s) दिखाता है, लेकिन इसके FP16/FP8/INT8 सेल जानबूझकर रिक्त हैं, नोट समझाता है कि AMD संरचित-sparse शिखर (1307 FP16 sparse, 2614 INT8 sparse) प्रकाशित करता है और dense लगभग आधा है — sparse संख्या को NVIDIA के dense के बगल में छापना एक भ्रामक तुलना होगी। TPU पंक्तियाँ एक अलग परंपरा फिर से दिखाती हैं: TPU v4 प्रति-चिप 275 पर BF16 को INT8 के बराबर रिपोर्ट करता है, जबकि लागत-अनुकूलित v5e INT8 को 197 BF16 के विरुद्ध 393 तक दोगुना करता है।

अक्सर पूछे जाने वाले प्रश्न#

TFLOPS बनाम TOPS — क्या वे एक ही चीज़ हैं?#

नहीं, और उन्हें भ्रमित करना सबसे सामान्य स्पेक-शीट जाल है। TFLOPS प्रति सेकंड फ़्लोटिंग-पॉइंट संक्रियाएँ मापता है (FLOPS परिवार, base-10 उपसर्ग: MFLOPS, GFLOPS, TFLOPS, PFLOPS)। TOPS प्रति सेकंड पूर्णांक या सामान्य संक्रियाएँ मापता है (OPS परिवार) और वह है जो आमतौर पर INT8 परिमाणित अनुमान हेतु उद्धृत दिखता है। क्योंकि अंतर्निहित संक्रिया भिन्न है, किसी चिप की TOPS संख्या उसकी TFLOPS संख्या के सीधे तौर पर तुलनीय नहीं है — और एक MAC (एक गुणन-संचय) परंपरागत रूप से दो FLOPs के रूप में गिनी जाती है, जो इसका हिस्सा है कि विक्रेता TOPS आंकड़े कभी-कभी दोहरी-गणना प्रतीत होते हैं।

MI300X कंप्यूट सेल रिक्त क्यों हैं?#

क्योंकि AMD अपना शिखर थ्रूपुट संरचित sparsity सक्षम के साथ प्रकाशित करता है (उदाहरण हेतु, 1307 FP16 TFLOPS sparse), जबकि यह तालिका हर चिप को तुलनीय रखने हेतु dense शिखर रिपोर्ट करती है। dense MI300X लगभग sparse आंकड़े का आधा है, लेकिन एक साफ़, सत्यापित dense संख्या लगातार उपलब्ध नहीं है, इसलिए सेल किसी छिपी “sparse” शर्त वाली संख्या छापने के बजाय रिक्त छोड़ा गया। मेमोरी और बैंडविड्थ — 192 GB और 5.3 TB/s — सत्यापित हैं और दिखाए गए हैं।

FP16 और BF16 में क्या अंतर है?#

दोनों 16 बिट हैं, लेकिन वे उन बिट्स को भिन्न ढंग से खर्च करते हैं। FP16 में अधिक परिशुद्धता है लेकिन संकीर्ण संख्यात्मक परास है; BF16 परिशुद्धता को FP32 जैसे परास के बदले देता है। वह परास प्रशिक्षण हेतु मायने रखता है, जहाँ ग्रेडिएंट परिमाण में भारी भिन्नता कर सकते हैं, इसीलिए BF16 आधुनिक tensor cores पर डिफ़ॉल्ट प्रशिक्षण प्रारूप बन गया है भले ही यह और FP16 एक ही बिट चौड़ाई पर काबिज़ हैं। परिशुद्धता-प्रारूप खंड दोनों को उनके सामान्य उपयोग के साथ सूचीबद्ध करता है।

“शिखर” का क्या अर्थ — क्या मेरा मॉडल वास्तव में इन संख्याओं तक पहुँचेगा?#

लगभग कभी नहीं। ये सैद्धांतिक शिखर हैं — वह थ्रूपुट जो चिप बनाए रख सकती यदि हर चक्र बिना मेमोरी रुकावट के पूर्ण उपयोग हो, जो वास्तविक कार्यभार कभी हासिल नहीं करते। निरंतर थ्रूपुट हमेशा कम होता है और kernel, मॉडल आर्किटेक्चर, batch आकार, और कार्यभार मेमोरी- या कंप्यूट-बाउंड है इस पर निर्भर करता है। शिखर को आर्किटेक्चर तुलना हेतु एक ऊपरी सीमा के रूप में लें, अपने मॉडल की गति की भविष्यवाणी के रूप में नहीं।