| భాగం | ఆర్టికల్ | కవర్ చేసేది |
|---|---|---|
| 1 | ఉచిత vs. చెల్లింపు AI మోడళ్లు: పదాలు నిజంగా ఏమి అర్థం | ప్రతి టైర్ అర్థం ఏమిటి, $0 వద్ద మీరు ఏమి కోల్పోతారు, లైసెన్స్లు, ఒక నిర్ణయ ఫ్రేమ్వర్క్ |
| 2 | ఓపెన్ AI మోడళ్లను మీరే నడపడం: అది నిజంగా ఏమి తీసుకుంటుంది (ఈ ఆర్టికల్) | హార్డ్వేర్, టూల్స్, నైపుణ్యాలు, మరియు సెల్ఫ్-హోస్టింగ్ యొక్క నిజమైన సవాళ్లు |
| 3 | ఓపెన్ AI మోడళ్లను ఎక్కడ కనుగొని సురక్షితంగా ధృవీకరించాలి | నమ్మదగిన మూలాలు, ట్యాంపర్ చేసిన డౌన్లోడ్లను గుర్తించడం, సురక్షిత పద్ధతులు |
| 4 | ఇప్పుడు తెలుసుకోవలసిన ఓపెన్ AI మోడళ్లు (తేదీ-గుర్తించిన స్నాప్షాట్) | 18 ప్రస్తుత ఉచిత మరియు ఓపెన్-వెయిట్ మోడళ్ల ఫీల్డ్ గైడ్ |
ఈ సిరీస్కు కొత్తా? ఈ ఆర్టికల్ ఆచరణాత్మకంగా మారడానికి ముందు, “చెల్లింపు,” “ఉచితం,” మరియు “ఓపెన్-వెయిట్” నిజంగా ఏమి అర్థమో 1వ భాగం వివరిస్తుంది.
డెమో వీడియో దాటవేసే భాగం
ఒక వీక్షకుడు ఒక ట్యుటోరియల్ను అనుసరిస్తాడు: ఈ ఫైల్ను డౌన్లోడ్ చేసి, ఒక కమాండ్ నడిపితే, ఒక ప్రైవేట్ AI అసిస్టెంట్ వారి సొంత ల్యాప్టాప్లో, ఎప్పటికీ ఉచితంగా నడుస్తుంది. కమాండ్ నడుస్తుంది. తర్వాత ల్యాప్టాప్ ఫ్యాన్లు వేగంగా తిరగడం మొదలవుతుంది, సమాధానం రావడానికి తొంభై సెకన్లు పడుతుంది, మరియు అదే వ్యక్తికి ఉచిత చాట్బాట్ యాప్ నుండి వచ్చే దానికంటే సమాధానం గమనించదగినంతగా తక్కువగా ఉంటుంది. ఆ భాగాన్ని వీడియో నుండి ఎవరూ ఎడిట్ చేసి తీసేయలేదు.
దీని అర్థం ఓపెన్-వెయిట్ మోడళ్లు చెడ్డ ఆలోచన అని కాదు — 1వ భాగం వాటిని ఇష్టపడటానికి నిజమైన కారణాలను, ముఖ్యంగా గోప్యతను, కవర్ చేసింది. దీని అర్థం “డౌన్లోడ్ చేయడానికి ఉచితం” మరియు “బాగా నడపడం సులభం” అనేవి రెండు వేర్వేరు వాదనలు, మరియు వాటిలో మొదటిది మాత్రమే నిజంగా నిజం. ఈ ఆర్టికల్ రెండవదాన్ని నిజాయితీగా కవర్ చేస్తుంది: పాఠకుడికి నిజంగా ఏ హార్డ్వేర్ అవసరం, ప్రజలు నిజంగా ఏ టూల్స్ వాడతారు, మరియు అనుభవం సమర్థవంతమైన అసిస్టెంట్లా అనిపిస్తుందా లేదా నిరాశపరిచే ప్రయోగంలా అనిపిస్తుందా అని నిర్ణయించే నిర్దిష్ట ట్రేడ్-ఆఫ్లు.
నిజంగా మీ మెమరీని ఏది తినేస్తుంది
ఒక ఓపెన్-వెయిట్ మోడల్ యొక్క పరిమాణం సాధారణంగా దాని పారామీటర్ కౌంట్ ద్వారా వివరించబడుతుంది — ఒక 7B మోడల్కు దాదాపు 7 బిలియన్ అంతర్గత సంఖ్యలు ఉంటాయి. మోడల్ నడుస్తున్నప్పుడు ఆ సంఖ్యలలో ప్రతి ఒక్కటి మెమరీలో (RAM, లేదా గ్రాఫిక్స్ కార్డ్ యొక్క VRAM) సరిపోవాలి, మరియు ప్రతి సంఖ్య ఎంత స్థలం తీసుకుంటుందనేది దాని ప్రెసిషన్ మీద ఆధారపడి ఉంటుంది.
| ప్రెసిషన్ | పారామీటర్కు బైట్లు | దీన్ని ఎవరు వాడతారు |
|---|---|---|
| fp16 (హాఫ్ ప్రెసిషన్) | 2 బైట్లు | చాలా మంది ప్రచురణకర్తలు మొదట అప్లోడ్ చేసే అసలైన, పూర్తి-నాణ్యత విడుదల |
| int8 (8-బిట్) | 1 బైట్ | ఒక మధ్యస్థ కంప్రెషన్, fp16 కంటే దాదాపు సగం మెమరీ |
| int4 (4-బిట్) | ~0.5 బైట్లు | ప్రజలు నిజంగా ఇంట్లో నడిపే అత్యంత సాధారణ “క్వాంటైజ్డ్” డౌన్లోడ్ |
ఇది, ఎలాంటి అదనపు ఓవర్హెడ్ లేకుండా, ఒక అంచనా-మెమరీ నియమాన్ని ఇస్తుంది (Hugging Face: Quantization overview):
| మోడల్ పరిమాణం | fp16 (పూర్తి నాణ్యత) | int8 | int4 (సాధారణ హోమ్ సెటప్) |
|---|---|---|---|
| 3B | ~6 GB | ~3 GB | ~1.5–2 GB |
| 7B | ~14 GB | ~7 GB | ~4 GB |
| 13B | ~26 GB | ~13 GB | ~7 GB |
| 34B | ~68 GB | ~34 GB | ~17–20 GB |
| 70B | ~140 GB | ~70 GB | ~35–40 GB |
ఈ సంఖ్యలు మోడల్ యొక్క వెయిట్స్కు మాత్రమే సంబంధించినవి. ఒక సంభాషణకు అవసరమయ్యే “వర్కింగ్ మెమరీ” కోసం (తర్వాత కవర్ చేయబడింది) దాదాపు 10–20% ఎక్కువ కలపండి, అలాగే ఆపరేటింగ్ సిస్టమ్ మరియు ఇతర యాప్లు ఇప్పటికే వాడుతున్నది కూడా. టేబుల్లో ఖచ్చితంగా ఉన్న సంఖ్య ఉన్న మెషీన్ ఆచరణలో సాధారణంగా సరిపోదు.
“ఇమిడిన” మోడల్ను దీర్ఘ సంభాషణ ఎందుకు క్రాష్ చేయగలదు
పెద్ద కాంటెక్స్ట్ విండోతో ప్రచారం చేయబడిన మోడల్ — ఒకేసారి గుర్తుంచుకోగల సంభాషణ మొత్తం, తరచుగా “128K కాంటెక్స్ట్” వంటి టోకెన్లలో మార్కెటింగ్ చేయబడుతుంది — ఆ కాంటెక్స్ట్ కోసం అదనపు మెమరీ అవసరం, దాని వెయిట్స్ ఇప్పటికే వాడుతున్న మెమరీకి వేరుగా. KV కాష్ అని పిలువబడే ఈ వర్కింగ్ మెమరీ, సంభాషణ పొడవు పెరిగే కొద్దీ పెరుగుతుంది.

బాగా లోడ్ అయి, మొదటి ప్రశ్నకు బాగా సమాధానం ఇచ్చే మోడల్, ఒక గంట పొడవైన సెషన్లో, ఒక పొడవైన డాక్యుమెంట్ అప్లోడ్లో, లేదా పెద్ద పేస్ట్ చేసిన కోడ్బేస్లో ఎందుకు విఫలమవుతుందో లేదా వేగం చాలా తగ్గిపోతుందో ఇదే కారణం — వెయిట్స్ మాత్రమే మొత్తం కథ కాదు.
ప్రజలు నిజంగా వాడే టూల్స్
దాదాపు ఎవరూ తమ సొంత ఇన్ఫరెన్స్ సెటప్ను మొదటి నుండి చేతితో నిర్మించరు. మూడు టూల్స్ చాలా వాస్తవ-ప్రపంచ వినియోగాన్ని కవర్ చేస్తాయి:
| టూల్ | అది ఏమిటి | దేనికి బాగా సరిపోతుంది | ప్లాట్ఫారమ్ |
|---|---|---|---|
| Ollama | ఒక కమాండ్-లైన్ టూల్ మరియు సింపుల్ లోకల్ సర్వర్; ఒక కమాండ్ ఒక మోడల్ను డౌన్లోడ్ చేసి నడుపుతుంది | టెర్మినల్తో సౌకర్యంగా ఉండే డెవలపర్లు మరియు టెక్నికల్ పాఠకులు | macOS, Windows, Linux |
| LM Studio | ఒక గ్రాఫికల్ డెస్క్టాప్ యాప్: పాయింట్ చేసి క్లిక్ చేయడం ద్వారా మోడళ్లను బ్రౌజ్ చేయడం, డౌన్లోడ్ చేయడం, మరియు చాట్ చేయడం | కమాండ్ లైన్ ముట్టుకోకుండా ఓపెన్-వెయిట్ మోడల్ను వాడాలనుకునే వ్యక్తులు | macOS, Windows, Linux |
| llama.cpp | Ollama తో సహా ఈ ఎకోసిస్టమ్లో చాలా భాగం నిర్మించబడిన అంతర్లీన ఇంజిన్ | పూర్తి నియంత్రణ కావాలనుకునే, లేదా తమ సొంత అప్లికేషన్లో మోడల్ను ఎంబెడ్ చేయాలనుకునే డెవలపర్లు | C++ టూల్చైన్ ఉన్న ఏ ప్లాట్ఫారమైనా |
పైన ఉన్న మెమరీ టేబుల్ నుండి క్వాంటైజ్డ్ (int4/int8) మోడల్ ఫార్మాట్లను మూడూ సపోర్ట్ చేస్తాయి, మరియు మూడూ వాడటానికి ఉచితం. పాఠకుడు ఎంచుకునే టూల్ మోడల్ ఏమి చేయగలదో మార్చదు — అక్కడికి చేరుకోవడానికి ఎంత టెక్నికల్ సౌకర్యం అవసరమో అది మారుస్తుంది.
ఇన్ఫ్లుయెన్సర్ కంటెంట్ దాటవేసే నిజమైన సవాళ్లు
- క్వాంటైజేషన్ ఒక నిజమైన ట్రేడ్-ఆఫ్, ఉచిత డిస్కౌంట్ కాదు. ఒక మోడల్ను fp16 నుండి 4-బిట్కు కంప్రెస్ చేయడం దాని మెమరీ అవసరాన్ని దాదాపు నాలుగు రెట్లు తగ్గిస్తుంది, కానీ ఇది కచ్చితత్వాన్ని కూడా గణనీయంగా తగ్గిస్తుంది, ముఖ్యంగా ఖచ్చితమైన రీజనింగ్, మ్యాథ్, మరియు కోడ్పై — ఒక భారీగా క్వాంటైజ్డ్ మోడల్ కాజువల్ చాట్లో బాగానే అనిపించవచ్చు, అయినా ఒక వ్యక్తికి నిజంగా అవసరమైన పనులలో విఫలం కావచ్చు.
- పెద్ద కాంటెక్స్ట్ విండోలకు వాటి సొంత మెమరీ అవసరం, పైన చూపినట్లుగా — మోడల్నే సౌకర్యవంతంగా లోడ్ చేసిన హార్డ్వేర్పై కూడా ఒక పొడవైన సంభాషణ, పెద్ద పేస్ట్ చేసిన డాక్యుమెంట్, లేదా మొత్తం కోడ్బేస్ మెమరీని అయిపోయేలా చేయగలవు.
- డౌన్లోడ్లు పెద్దవి. 4-బిట్ క్వాంటైజ్డ్ ఫైళ్లు కూడా సాధారణంగా కొన్ని గిగాబైట్ల నుండి అనేక డజన్ల వరకు ఉంటాయి; అసలైన fp16 విడుదలలు అతిపెద్ద మోడళ్లకు వందల గిగాబైట్లలో ఉంటాయి. మొదటి రన్ అంటే నిజమైన వేచి ఉండటం మరియు నిజమైన ఖాళీ డిస్క్ స్థలం, ఐదు-సెకన్ల ఇన్స్టాల్ కాదు.
- సపోర్ట్ లైన్ ఏదీ లేదు. డ్రైవర్ కాన్ఫ్లిక్ట్, ఒక అర్థంకాని క్రాష్, లేదా లోడ్ కావడానికి నిరాకరించే మోడల్ కమ్యూనిటీ ఫోరమ్లు, GitHub ఇష్యూలు, మరియు ట్రయల్ అండ్ ఎర్రర్ ద్వారా పరిష్కరించబడతాయి — ఎప్పుడూ చాట్-సపోర్ట్ ఏజెంట్ ద్వారా కాదు.
- ఏదీ స్వయంగా ప్యాచ్ కాదు. సెక్యూరిటీ ఫిక్స్లు, బగ్ ఫిక్స్లు, మరియు మెరుగైన క్వాంటైజ్డ్ వెర్షన్లు కొనసాగుతూ కనిపిస్తాయి, కానీ డౌన్లోడ్ చేసిన మోడల్ ఫైల్ పాఠకుడు తిరిగి వెళ్లి అప్డేట్ను స్వయంగా డౌన్లోడ్ చేసుకుంటేనే సురక్షితంగా లేదా మెరుగ్గా మారుతుంది.
- ఒక మోడల్ ఎలా ప్రవర్తిస్తుందో మార్చడం పూర్తిగా వేరే నైపుణ్యం. ప్రచురించిన విధంగా మోడల్ను నడపడం సులభమే. ఫైన్-ట్యూనింగ్ ద్వారా దానికి కొత్త ప్రవర్తనను నేర్పించడం లోతైన మెషిన్-లెర్నింగ్ నైపుణ్యం, మరియు ఇది ఈ ఆర్టికల్ పరిధిలో లేదు.
- వేడి, శబ్దం, మరియు విద్యుత్ నిజమైన ఖర్చులు. నిరంతర లోకల్ ఇన్ఫరెన్స్ ల్యాప్టాప్ ఫ్యాన్లను బిగ్గరగా తిప్పుతుంది మరియు బ్యాటరీలను వేగంగా ఖాళీ చేస్తుంది; ఒక అంకిత GPU గణనీయమైన శక్తిని తీసుకుంటుంది. ఇది ఈ సిరీస్ 1వ భాగంలో వివరించిన “దాగిన బిల్లు” — ఇది సబ్స్క్రిప్షన్కు బదులుగా విద్యుత్లో చెల్లించబడుతుంది అంతే.
నైపుణ్య పరిమితి, నిజాయితీగా
Ollama లేదా LM Studio వాడటానికి కోడ్ రాయడం తెలియాల్సిన అవసరం లేదు. అయితే దీనికి ఇవి అవసరం:
- టెర్మినల్ నుండి సాఫ్ట్వేర్ ఇన్స్టాల్ చేయడంలో సౌకర్యం, లేదా డౌన్లోడ్ చేసిన డెస్క్టాప్ యాప్ను నమ్మి కాన్ఫిగర్ చేయడం
- మీ హార్డ్వేర్కు సరైన క్వాంటైజ్డ్ వెర్షన్ను ఎంచుకోవడానికి, ఊహించడం కాకుండా, మోడల్ యొక్క సొంత డాక్యుమెంటేషన్ను (“మోడల్ కార్డ్”) చదవడం
- ప్రాథమిక ట్రబుల్షూటింగ్: ఎర్రర్ మెసేజ్ను చదవడం, గ్రాఫిక్స్ డ్రైవర్ ఇన్స్టాల్ చేయబడిందా మరియు అప్-టు-డేట్గా ఉందా అని తనిఖీ చేయడం
- బహు-గిగాబైట్ డౌన్లోడ్ల కోసం మరియు అప్పుడప్పుడు విఫలమయ్యే దాని కోసం సహనం
లక్ష్యం మోడల్ను వాడటం మాత్రమే కాకుండా దానిపై ఒక ఉత్పత్తిని నిర్మించడం అయితేనే కోడ్ రాయడం, Python వాడటం, లేదా అంతర్లీన ఆర్కిటెక్చర్ను అర్థం చేసుకోవడం అవసరం.
మీరు వాస్తవంగా నడపగలిగే దానికి మీ హార్డ్వేర్ను సరిపోల్చడం
| మీ సెటప్ | సౌకర్యంగా ఏమి నడుస్తుంది | ఏమి ఆశించాలి |
|---|---|---|
| బేసిక్ ల్యాప్టాప్, 8 GB RAM, అంకిత GPU లేదు | 1–3B మోడళ్లు, 4-బిట్ | డ్రాఫ్టింగ్ మరియు సాధారణ ప్రశ్నలకు బాగానే ఉంటుంది; సంక్లిష్ట రీజనింగ్పై నెమ్మది మరియు నాసిరకం |
| ఆధునిక ల్యాప్టాప్ లేదా డెస్క్టాప్, 16 GB RAM, 8 GB VRAM | 7B, 4-బిట్ | విస్తృతంగా మధ్య-స్థాయి ఉచిత హోస్ట్ చేయబడిన చాట్బాట్తో పోల్చదగిన, ఘనమైన రోజువారీ నాణ్యత |
| గేమింగ్ లేదా క్రియేటర్ డెస్క్టాప్, 16–24 GB VRAM | 13B–24B, 4-బిట్ | గమనించదగ్గ మెరుగైన రీజనింగ్ మరియు కోడింగ్ సామర్థ్యం |
| హై-ఎండ్ వర్క్స్టేషన్ లేదా అద్దె క్లౌడ్ GPU | 34B–70B+ | నిజమైన హార్డ్వేర్ లేదా క్లౌడ్ రెంటల్ ఖర్చు వద్ద, చాలా చెల్లింపు హోస్ట్ చేయబడిన టైర్లు అందించే దానికి దగ్గరగా వస్తుంది |
1వ భాగం నుండి వచ్చిన నమూనా ఇక్కడ కూడా వర్తిస్తుంది: ప్రతి టైర్లో మెరుగైన ఫలితాలు అందుబాటులో ఉంటాయి, కానీ “ఉచితం” ఎప్పటికీ దేనితోనైనా ట్రేడ్ చేస్తూనే ఉంటుంది — ఈ సందర్భంలో, హార్డ్వేర్ ఖర్చు, సెటప్ సమయం, మరియు కొనసాగుతున్న విద్యుత్.
ఈ సిరీస్ను కొనసాగించండి
- భాగం 1 — ఉచిత vs. చెల్లింపు AI మోడళ్లు: పదాలు నిజంగా ఏమి అర్థం. చెల్లింపు, ఉచితం, మరియు ఓపెన్-వెయిట్ మధ్య తేడా ఇంకా అస్పష్టంగా ఉంటే ఇక్కడ నుండి ప్రారంభించండి.
- భాగం 3 — ఓపెన్ AI మోడళ్లను ఎక్కడ కనుగొని సురక్షితంగా ధృవీకరించాలి. ఒకదాన్ని నడపడం ఇప్పుడు సాధ్యమైన తర్వాత, తర్వాతి ప్రశ్న ఫైల్ను నిజంగా ఎక్కడ నుండి పొందాలి, మరియు చట్టబద్ధమైన మోడల్ను ట్యాంపర్ చేసిన దాని నుండి ఎలా చెప్పాలి అనేది.
- భాగం 4 — ఇప్పుడు తెలుసుకోవలసిన ఓపెన్ AI మోడళ్లు. పైన ఉన్న హార్డ్వేర్ గైడెన్స్ను నిర్దిష్ట ఎంపికలతో సరిపోల్చుకోవడానికి, ప్రస్తుత ఉచిత మరియు ఓపెన్-వెయిట్ మోడళ్ల తేదీ-గుర్తించిన ఫీల్డ్ గైడ్.
మరింత లోతుగా
- Quantization overview — Hugging Face. పైన ఉన్న టేబుళ్లలో వాడిన ప్రెసిషన్-టు-మెమరీ సంబంధం. సెప్టెంబర్ 2026లో సమీక్షించబడింది.
- Ollama — పైన చర్చించిన కమాండ్-లైన్ టూల్ కోసం అధికారిక సైట్ మరియు మోడల్ లైబ్రరీ.
- LM Studio — పైన చర్చించిన గ్రాఫికల్ డెస్క్టాప్ టూల్ కోసం అధికారిక సైట్.
- llama.cpp — దాని సొంత క్వాంటైజేషన్ డాక్యుమెంటేషన్తో సహా, లోకల్-AI టూలింగ్ ఎకోసిస్టమ్లో చాలా భాగానికి అంతర్లీనంగా ఉన్న ఓపెన్-సోర్స్ ఇన్ఫరెన్స్ ఇంజిన్.
ప్రతి విడుదల చక్రంతో హార్డ్వేర్ అవసరాలు మరియు టూల్ సామర్థ్యాలు మారతాయి. పైన ఉన్న మెమరీ టేబుల్ను ప్లానింగ్ అంచనాగా పరిగణించండి, మరియు హార్డ్వేర్కు కట్టుబడి ఉండే ముందు నిర్దిష్ట మోడల్ యొక్క సొంత పేజీలో దాని అసలైన ఫైల్ పరిమాణాలను తనిఖీ చేయండి.
