ఒక ఆన్లైన్ రిటైలర్ సంవత్సరంలో తన అతిపెద్ద సేల్ కోసం సిద్ధమవుతోంది. అప్లికేషన్ లోడ్ టెస్ట్లను పాస్ చేసింది. ఆటోస్కేలింగ్ ఎనేబుల్ చేయబడింది, సర్వీస్ కోటాలు పెంచబడ్డాయి, క్లౌడ్ స్టేటస్ పేజీ ఎలాంటి సమస్యలు చూపించడం లేదు.
సేల్ ప్రారంభమైనప్పుడు, ఊహించినట్లుగా ట్రాఫిక్ పెరుగుతుంది. ఆటోస్కేలర్ మరిన్ని వర్చువల్ మెషీన్లను అభ్యర్థిస్తుంది, కానీ క్లౌడ్ ప్లాట్ఫారమ్ ఆ జోన్లో ఎంచుకున్న మెషీన్ టైప్ను అందించలేకపోతుంది. కొన్ని స్కేలింగ్ రిక్వెస్ట్లు విఫలమవుతాయి.
ప్రొవైడర్ రీజనల్ అవుటేజ్ను ఎదుర్కోలేదు. ఇతర కస్టమర్లు, సర్వీసులు సాధారణంగా పనిచేస్తుండవచ్చు. అయినా ఈ అప్లికేషన్కు అవసరమైన వనరులు లభించవు.
క్లౌడ్ సర్వీసులు సాధారణంగా అపరిమితంగా అనిపిస్తాయి కాబట్టి ఆ పరిస్థితి టీమ్లను ఆశ్చర్యపరుస్తుంది. మేము API ద్వారా మౌలిక సదుపాయాన్ని అభ్యర్థించి కొన్ని నిమిషాల్లో పొందుతాము. ఇది వందల సార్లు పనిచేసిన తర్వాత, సామర్థ్యాన్ని సర్వీస్ యొక్క శాశ్వత లక్షణంగా పరిగణించడం సులభం.
అది కాదు. API ఇప్పటికీ ఒక నిజమైన ప్రదేశంలో ఉన్న భౌతిక పరికరాలపై ఆధారపడి ఉంటుంది.
ఒక క్లౌడ్ రిక్వెస్ట్ వెనుక ఏముంది
ఒక వర్చువల్ మెషీన్ రిక్వెస్ట్కు చివరికి సరైన ప్రాసెసర్, మెమరీ, స్థానిక కనెక్షన్లు ఉన్న సర్వర్ అవసరం. ఒక GPU రిక్వెస్ట్కు ఒక నిర్దిష్ట యాక్సిలరేటర్, మద్దతు ఇచ్చే హార్డ్వేర్ అవసరం. రెండూ స్టోరేజ్, నెట్వర్క్లు, కూలింగ్, విద్యుత్, అందుబాటులో ఉన్న డేటా-సెంటర్ స్థలంపై ఆధారపడతాయి.
ఆ వనరులు నిర్దిష్ట సదుపాయాల్లో ఇన్స్టాల్ చేయబడతాయి. ఒక ప్రదేశంలో డిమాండ్ పెరిగితే, మరో ప్రాంతంలో ఉపయోగించని హార్డ్వేర్ దాన్ని వెంటనే తీర్చలేదు. ప్రొవైడర్లు మౌలిక సదుపాయాన్ని జోడించగలరు, కానీ కొత్త డేటా-సెంటర్ సామర్థ్యాన్ని ప్రణాళిక చేయడానికి, పవర్ చేయడానికి, నిర్మించడానికి, కనెక్ట్ చేయడానికి సమయం పడుతుంది.
ఆ పని యొక్క స్థాయి పెరుగుతోంది. ప్రపంచవ్యాప్త డేటా-సెంటర్ విద్యుత్ వినియోగం 2030 నాటికి సుమారు 945 టెరావాట్-గంటలకు రెట్టింపు కంటే ఎక్కువ కావచ్చని International Energy Agency యొక్క Energy and AI విశ్లేషణ అంచనా వేస్తుంది. దీని అర్థం క్లౌడ్ సామర్థ్యం సాధారణంగా అయిపోతోందని కాదు. విస్తరణ ఇప్పుడు సర్వర్లను కొనుగోలు చేయడం కంటే ఎక్కువపై ఆధారపడి ఉందని ఇది చూపిస్తుంది. విద్యుత్, మద్దతు ఇచ్చే మౌలిక సదుపాయం కూడా సరైన ప్రదేశాలకు చేరుకోవాలి.
మీ ఖాతా రేపు ఉదయం ఒక జోన్లో ఒక నిర్దిష్ట GPUను లాంచ్ చేయగలదా అని ప్రొవైడర్ యొక్క గ్లోబల్ పెట్టుబడి చాలా తక్కువ చెబుతుంది.
“అందుబాటులో ఉంది” అనేక విషయాలను అర్థం చేసుకోవచ్చు
ఒక నిర్దిష్ట జోన్లో ఒక టైప్కు చెందిన ఇరవై మెషీన్లు ఒక టీమ్కు కావాలని అనుకుందాం. రిక్వెస్ట్ విజయవంతం కావడానికి ముందు, అనేక షరతులు నిజం కావాలి.
| తనిఖీ | దీని అర్థం ఏమిటి |
|---|---|
| సర్వీస్ కవరేజ్ | మెషీన్ ఫ్యామిలీ, అవసరమైన ఫీచర్లు ఆ రీజియన్ లేదా జోన్లో అందించబడతాయి. |
| అకౌంట్ కోటా | ఆ పరిమాణాన్ని అభ్యర్థించడానికి ప్రాజెక్ట్ లేదా సబ్స్క్రిప్షన్కు అనుమతి ఉంది. |
| ప్రస్తుత సామర్థ్యం | ఆ క్షణంలో సరిపోయే హార్డ్వేర్ ప్రొవైడర్ వద్ద ఖాళీగా ఉంది. |
| కెపాసిటీ అష్యూరెన్స్ | అవసరమైన వనరులను ఒక చెల్లుబాటు అయ్యే రిజర్వేషన్ లేదా అలాంటి ఏర్పాటు కలిగి ఉంటుంది. |
| వర్క్లోడ్ అందుబాటు | ఒక వనరును కేటాయించలేనప్పుడు అప్లికేషన్ ఉపయోగపడేదిగా ఉండగలదు లేదా కోలుకోగలదు. |
ఈ తనిఖీలు సంబంధం కలిగి ఉంటాయి, కానీ అవి పరస్పరం మార్చుకోదగినవి కావు.
ఒక జోన్లో ఖాళీ సామర్థ్యం లేనప్పుడు కూడా ఒక మెషీన్ టైప్ ప్రాంతీయ కేటలాగ్లో కనిపించవచ్చు. కస్టమర్ కోటా చాలా తక్కువగా ఉన్నప్పుడు కూడా హార్డ్వేర్ అందుబాటులో ఉండవచ్చు. ఒక రిజర్వేషన్ ఒక జోన్లో కంప్యూట్ను సురక్షితం చేయగలదు, కానీ అప్లికేషన్ను జోనల్ వైఫల్యానికి బహిర్గతంగా వదిలేయవచ్చు.
అందుకే “సర్వీస్ అందుబాటులో ఉంది” అనే పదబంధం కెపాసిటీ ప్రణాళిక కోసం చాలా అస్పష్టం.
కోటా ఆమోదం భౌతిక సామర్థ్యాన్ని నిర్ధారించదు
ఒక అకౌంట్, ప్రాజెక్ట్, లేదా సబ్స్క్రిప్షన్ ఎంత వనరును ఉపయోగించవచ్చో ఒక కోటా నియంత్రిస్తుంది. ఒక అకౌంట్ 100 వర్చువల్ CPUలకు పరిమితమై ఉంటే, వినియోగాన్ని 120కి పెంచే ఒక రిక్వెస్ట్, ప్రొవైడర్ వద్ద చాలా హార్డ్వేర్ ఉన్నప్పటికీ విఫలం కావచ్చు.
ఎక్కువ పరిమితిని అభ్యర్థించడం, వినియోగాన్ని తగ్గించడం, లేదా వర్క్లోడ్లో కొంత భాగాన్ని తరలించడం ద్వారా టీమ్లు సాధారణంగా దీన్ని పరిష్కరిస్తాయి. ఆమోదాలకు సమయం పట్టవచ్చు కాబట్టి కోటా తనిఖీలు రిలీజ్, ఈవెంట్ ప్రణాళికలో భాగంగా ఉండాలి.
భౌతిక సామర్థ్యం వేరే విషయం. అకౌంట్కు 500 వర్చువల్ CPUల కోటా ఉండవచ్చు, కానీ ఒక జోన్లో ఒక నిర్దిష్ట మెషీన్ ఫ్యామిలీకి చెందిన 200 CPUలను పొందడంలో ఇప్పటికీ విఫలం కావచ్చు.
ఇది అసాధారణమైన లేదా దాచిన ప్రవర్తన కాదు. AWS డాక్యుమెంటేషన్ InsufficientInstanceCapacity ఎర్రర్లను వివరిస్తుంది, వేరే ఇన్స్టాన్స్ టైప్, Availability Zone, లేదా సమయాన్ని ప్రయత్నించమని సూచిస్తుంది. Microsoft యొక్క Azure మార్గదర్శకత్వం ఎంచుకున్న ప్రదేశంలో ఇష్టపడే VM టైప్ తాత్కాలికంగా అందుబాటులో లేకపోవచ్చని వివరిస్తుంది. vCPUలు, GPUల వంటి రిక్వెస్ట్ల కోసం ఇలాంటి రిసోర్స్-అవైలబిలిటీ ఎర్రర్లను Google Cloud డాక్యుమెంట్ చేస్తుంది.
ఆమోదించబడిన కోటా అంటే అకౌంట్ అడగడానికి అనుమతించబడింది. సమాధానం అవుననే అని అది హామీ ఇవ్వదు.
ఆటోస్కేలింగ్ దాని పరిమితిని ఎక్కడ చేరుకుంటుంది
ఆటోస్కేలింగ్ మరిన్ని వనరులను అభ్యర్థించడం ద్వారా డిమాండ్కు స్పందిస్తుంది. అందుబాటులో లేని హార్డ్వేర్ను అది ఉత్పత్తి చేయలేదు.
రిటైలర్ను మళ్లీ పరిగణించండి. టీమ్ ఆ కాన్ఫిగరేషన్ను పరీక్షించి ప్రొడక్షన్లోకి కాపీ చేసినందున దాని స్కేలింగ్ పాలసీ కేవలం ఒక మెషీన్ ఫ్యామిలీని మాత్రమే అనుమతిస్తుంది. అన్ని ఇన్స్టాన్స్లు మరో డిపెండెన్సీ ఉన్న అదే జోన్లో నడవాలి. సామర్థ్యం తగ్గినప్పుడు, ప్లాట్ఫారమ్ తీర్చలేని రిక్వెస్ట్ను ఆటోస్కేలర్ పునరావృతం చేస్తుంది.
అప్లికేషన్కు ఆటోమేటెడ్ స్కేలింగ్ ఉంది, కానీ దానికి వశ్యత లేదు.
రెండు లేదా మూడు పరీక్షించిన మెషీన్ ఫ్యామిలీలను అనుమతించడం, జోన్ల అంతటా సామర్థ్యాన్ని పంపిణీ చేయడం, వచ్చే పనిని ఒక క్యూలో ఉంచడం, లేదా పీక్ సమయంలో అనవసరమైన ప్రాసెసింగ్ను తగ్గించడం ద్వారా మెరుగైన డిజైన్ ఉండవచ్చు. సరైన ఎంపిక వర్క్లోడ్పై ఆధారపడి ఉంటుంది. స్టేట్లెస్ వెబ్ సర్వర్ల పూల్ అంత సులభంగా ఒక లైసెన్స్ చేసిన డేటాబేస్ అప్లయెన్స్ కాన్ఫిగరేషన్లను మార్చలేదు.
ప్రత్యేకమైన, పెద్ద కాన్ఫిగరేషన్లకు అదనపు శ్రద్ధ అవసరం. GPU క్లస్టర్లు, అసాధారణంగా పెద్ద మెషీన్లు, గట్టిగా ప్యాక్ చేసిన కంప్యూట్ ఫ్లీట్లు ప్రొవైడర్కు తక్కువ ప్లేస్మెంట్ ఎంపికలను ఇస్తాయి. డిమాండ్ రాకముందే వశ్యతను డిజైన్ చేసి పరీక్షించాలి.
ఒక రిజర్వేషన్ ఎప్పుడు అర్థవంతంగా ఉంటుంది
బెస్ట్-ఎఫర్ట్ కేటాయింపుపై ఆధారపడలేని వర్క్లోడ్ల కోసం ప్రొవైడర్లు కెపాసిటీ రిజర్వేషన్లను అందిస్తారు. ఉదాహరణకు, AWS EC2 Capacity Reservations ఒక నిర్దిష్ట Availability Zoneలో ఒక పేర్కొన్న కాన్ఫిగరేషన్ను కలిగి ఉండగలవు. అభ్యర్థించిన సామర్థ్యాన్ని ఒక జోన్లో రిజర్వ్ చేయడానికి ముందు Google Cloud రిజర్వేషన్లు కూడా అందుబాటులో ఉందని నిర్ధారిస్తాయి.
ఇది ఒక ప్రణాళికాబద్ధమైన మైగ్రేషన్, ఒక పెద్ద సేల్, ఒక రికవరీ అవసరం, లేదా అరుదైన యాక్సిలరేటర్లు అవసరమైన వర్క్లోడ్కు ఉపయోగకరంగా ఉంటుంది. సంస్థ ఎక్కువ నిశ్చయత కోసం చెల్లిస్తుంది, రిజర్వేషన్ యొక్క కాన్ఫిగరేషన్, స్థాన నియమాలను అంగీకరిస్తుంది.
ఒక ముఖ్యమైన హద్దు ఉంది: రిజర్వ్ చేసిన కంప్యూట్ మొత్తం సర్వీస్ను రెసిలియంట్గా చేయదు. ప్రతి రిజర్వ్ చేసిన మెషీన్ ఒక జోన్లో ఉంటే, ఒక జోనల్ సమస్య ఇప్పటికీ ఫ్లీట్ను ప్రభావితం చేయగలదు. అప్లికేషన్ ఒక డేటాబేస్, ఐడెంటిటీ సర్వీస్, లేదా నెట్వర్క్ పాత్పై కూడా ఆధారపడవచ్చు. ప్రతి డిపెండెన్సీకి దాని సొంత అందుబాటు, రికవరీ డిజైన్ అవసరం.
కంప్యూట్ను కేటాయించగలరా అనే ప్రశ్నకు రిజర్వేషన్ సమాధానం ఇవ్వడంలో సహాయపడుతుంది. బిజినెస్ సర్వీస్ ఒక వైఫల్యాన్ని తట్టుకుంటుందా అనే ప్రశ్నకు ఇది సమాధానం ఇవ్వదు.
స్టాప్ చేసిన-మెషీన్ ఊహ
బిజినెస్ అవర్స్ వెలుపల టీమ్లు కొన్నిసార్లు మెషీన్లను ఆపుతాయి లేదా విపత్తు రికవరీ కోసం డీఅలొకేటెడ్ వనరులను ఉంచుతాయి. కాన్ఫిగరేషన్ కన్సోల్లో కనిపిస్తూనే ఉంటుంది, ఇది హార్డ్వేర్ ఇప్పటికీ వేచి ఉందనే అభిప్రాయాన్ని సృష్టించగలదు.
సర్వీస్, రిజర్వేషన్ ఏర్పాటును బట్టి, ఒక మెషీన్ను ఆపడం లేదా డీఅలొకేట్ చేయడం దాని భౌతిక సామర్థ్యాన్ని విడుదల చేయవచ్చు. తర్వాత దాన్ని రీస్టార్ట్ చేయడానికి కొత్త కేటాయింపు అవసరం కావచ్చు. ఆ మెషీన్ టైప్ పరిమితం అయితే, ఇంతకు ముందు పనిచేసినప్పటికీ రీస్టార్ట్ విఫలం కావచ్చు.
అందుకే ఒక రికవరీ టెస్ట్ టెంప్లేట్లను పరిశీలించడం, బ్యాకప్లు ఉన్నాయని నిర్ధారించడం కంటే ఎక్కువ చేయాలి. టీమ్ అవసరమైన వనరులను ప్రారంభించాలి లేదా సృష్టించాలి, డేటాను పునరుద్ధరించాలి, డిపెండెన్సీలను తిరిగి కనెక్ట్ చేయాలి, ఉపయోగపడే సర్వీస్ను అందించడానికి ఎంత సమయం పడుతుందో కొలవాలి. ఒక చిన్న మెషీన్తో విజయవంతమైన టెస్ట్, పూర్తి ప్రొడక్షన్ ఫ్లీట్ను పునరుద్ధరించగలదని నిరూపించదు.
తదుపరి పీక్కు ముందు పరిష్కరించాల్సిన ప్రశ్నలు
వర్క్లోడ్లో కదలలేని భాగాలను జాబితా చేయడంతో ప్రారంభించండి. డేటా-రెసిడెన్సీ నియమాలకు ఒక రీజియన్ అవసరం కావచ్చు. సాఫ్ట్వేర్ లైసెన్స్లు ఇన్స్టాన్స్ టైప్లను పరిమితం చేయవచ్చు. పనితీరు అవసరాలు ఒక సర్వీస్ను GPU ఫ్యామిలీకి లేదా లోకల్ స్టోరేజ్కు కట్టిపడేయవచ్చు. ఈ పరిమితులు ఎన్ని ప్రత్యామ్నాయాలు నిజంగా అందుబాటులో ఉన్నాయో నిర్ణయిస్తాయి.
తర్వాత కింది వాటికి సమాధానం ఇవ్వండి:
- ఏ కోటాలు వృద్ధిని అడ్డుకోగలవు, అవి చివరిసారి ఎప్పుడు తనిఖీ చేయబడ్డాయి?
- ఏ ప్రత్యామ్నాయ మెషీన్ టైప్లు నిజంగా పరీక్షించబడ్డాయి?
- డేటా, లేటెన్సీ, లేదా లైసెన్సింగ్ అవసరాలను విచ్ఛిన్నం చేయకుండా వర్క్లోడ్ మరో జోన్ను ఉపయోగించగలదా?
- బెస్ట్-ఎఫర్ట్ కేటాయింపు కాకుండా ఏ ఈవెంట్లకు రిజర్వ్ చేసిన సామర్థ్యం అవసరం?
- కొత్త సామర్థ్యం అందుబాటులో లేనప్పుడు వచ్చే పనికి ఏం జరుగుతుంది?
- రికవరీ ప్రణాళిక కేవలం ఒక డెమోన్స్ట్రేషన్ ఇన్స్టాన్స్ను కాకుండా పూర్తి అవసరమైన ఫ్లీట్ను కేటాయించగలదా?
- ఆటోమేషన్ ఒక కెపాసిటీ ఎర్రర్ను గుర్తించి ఆమోదించిన ప్రత్యామ్నాయాన్ని ఎంచుకుంటుందా, లేదా కేవలం ఎప్పటికీ రిట్రై చేస్తుందా?
ప్రతి సిస్టమ్కు బహుళ రీజియన్లు లేదా రిజర్వ్ చేసిన హార్డ్వేర్ అవసరం లేదు. సీజనల్ పీక్ సమయంలో పేమెంట్ ప్లాట్ఫారమ్ కంటే ఒక చిన్న అంతర్గత సర్వీస్ ఎక్కువ రిస్క్ను అంగీకరించగలదు. కెపాసిటీ కోసం వేచి ఉండటం యొక్క బిజినెస్ ప్రభావంతో రక్షణ ఖర్చును పోల్చి, నిర్ణయం ఉద్దేశపూర్వకంగా ఉండాలి.
టీమ్లు ఏం నేర్చుకోవాలి
క్లౌడ్ సిస్టమ్లను ఆమోదించే లేదా డిజైన్ చేసే వ్యక్తులు రీజనల్ సర్వీస్ కవరేజ్, అకౌంట్ కోటా, ప్రస్తుత భౌతిక సామర్థ్యం, రిజర్వేషన్లు, అప్లికేషన్ అందుబాటు మధ్య తేడాను అర్థం చేసుకోవాలి.
క్లౌడ్, ప్లాట్ఫారమ్, రిలయబిలిటీ ఇంజనీర్లకు కోటాలు, ప్రత్యామ్నాయ కాన్ఫిగరేషన్లు, స్కేలింగ్ ప్రవర్తన, రిజర్వేషన్లు, వాస్తవిక రికవరీ టెస్ట్లతో ఆచరణాత్మక అనుభవం అవసరం. చిన్న డిజైన్ ఎంపికలు ఫాల్బ్యాక్ ఎంపికలను తొలగించగలవు కాబట్టి పెద్ద యాక్సిలరేటర్ ఫ్లీట్లకు లేదా క్రిటికల్ ప్లాట్ఫారమ్లకు బాధ్యత వహించే ఇంజనీర్లకు ప్లేస్మెంట్ పరిమితులు, కెపాసిటీ కట్టుబాట్లపై లోతైన పరిజ్ఞానం అవసరం.
ఈ విషయం ఒక క్లౌడ్ ప్రొవైడర్ మౌలిక సదుపాయం అయిపోతుందా అని అంచనా వేయడం గురించి కాదు. ఇది ఒక వర్క్లోడ్ లోపల ఊహలను కనుగొనడం గురించి.
తదుపరి మైగ్రేషన్, సేల్, లేదా రికవరీ వ్యాయామానికి ముందు, ఒక ఖచ్చితమైన ప్రశ్న అడగండి: ఎంచుకున్న ప్రదేశంలో ఇష్టపడే వనరును కేటాయించలేకపోతే, సిస్టమ్ ఏం చేస్తుంది?
ఎవరూ సమాధానాన్ని పరీక్షించకపోతే, కెపాసిటీ ప్రణాళిక అసంపూర్ణంగా ఉంది.
సూచనలు మరియు మరింత చదవడం
- Energy demand from AI — International Energy Agency. డేటా-సెంటర్ విద్యుత్ వినియోగం, కెపాసిటీ విస్తరణ వెనుక ఉన్న మౌలిక సదుపాయం కోసం అంచనాలు.
- Troubleshoot Amazon EC2 instance launch issues — AWS. అసంపూర్ణ-సామర్థ్య లాంచ్ ఎర్రర్లకు కారణాలు, స్పందనలు.
- Troubleshoot Azure VM allocation failures — Microsoft. ప్రదేశం, VM సైజు, డిప్లాయ్మెంట్ పరిమితులు కేటాయింపును ఎలా ప్రభావితం చేస్తాయో.
- Troubleshooting resource availability errors — Google Cloud. జోనల్ వనరుల కొరత, అందుబాటులో ఉన్న స్పందనలు.
- EC2 On-Demand Capacity Reservations — AWS. జోనల్ కెపాసిటీ రిజర్వేషన్లు ఎలా పనిచేస్తాయో.
- Compute Engine reservations overview — Google Cloud. Compute Engine రిజర్వ్ చేసిన వనరులను ఎలా ధృవీకరిస్తుంది, ఎలా కలిగి ఉంటుందో.
