Skip to main content

جنرل ایجنٹس

یہ وہ ٹولز ہیں جو صرف بات نہیں کرتے: کام کرتے ہیں۔ ان میں سے ایک کو چلانا سیکھیں؛ کتاب میں آگے کی ہر چیز اسی پر بنتی ہے۔

Foundations نے آپ کو سکھایا کہ AI کیا ہے اور اسے استعمال کرتے ہوئے اپنی judgment کیسے قائم رکھنی ہے۔ یہ حصہ وہ جگہ ہے جہاں آپ وہ ٹول اٹھاتے ہیں جسے آپ باقی کتاب میں استعمال کریں گے: ایک جنرل ایجنٹ، یعنی ایسا AI جو صرف جواب نہیں دیتا، بلکہ عمل کرتا ہے۔ یہ آپ کی files کھولتا ہے، انہیں پڑھتا ہے، code لکھتا اور run کرتا ہے، اور task مکمل کرنے کے لیے دوسری apps بھی استعمال کرتا ہے۔

شروع کرنے کے لیے آپ کو کچھ install کرنے کی ضرورت نہیں۔ اس حصے میں آپ کا پہلا قدم اسی browser tab میں اٹھتا ہے جہاں Foundations چلا تھا:

  • Web پر جنرل ایجنٹس: پورے حصے کا مرکزی دروازہ۔ کچھ install کیے بغیر browser tab سے اپنے پہلے حقیقی ایجنٹ کو direct کریں۔ آپ remote session، اپنی files کی اصل جگہ، phone تک پہنچنے والی approval، اور ہر نئے agent product کو ایک مشترک ساخت کے ذریعے سمجھنا سیکھیں گے۔ چاہے آپ code کر سکتے ہوں یا نہیں، پہلے دن ہر شخص یہیں سے شروع کرتا ہے۔

جب آپ agent کو اپنی مشین پر لانے کے لیے تیار ہوں، تو باقی حصے میں داخل ہونے کے دو دروازے ہیں، اور کون سا لینا ہے یہ صرف اس پر منحصر ہے کہ آپ کون ہیں:

  • Claude Code اور OpenCode: ان لوگوں کے لیے جو code کے ساتھ کام کرتے ہیں۔
  • Cowork اور OpenWork: باقی سب کے لیے، وہی طاقت ایک desktop app میں، جو professional اور knowledge work کے لیے بنی ہے۔

خیال وہی ہے، audience مختلف ہے: ایسا AI جسے آپ حقیقی کام کروانے کے لیے direct کرتے ہیں، نہ کہ ایسا AI جس سے آپ صرف chat کرتے ہیں۔

یہ پوری کتاب کا مرکزی جوڑ ہے۔ اس کے بعد آنے والی تقریبا ہر چیز یہ فرض کرتی ہے کہ آپ جنرل ایجنٹ چلا سکتے ہیں۔ Mode 1 (مسئلہ ایک بار حل کرنا) اور Mode 2 (پائیدار worker بنانا)، دونوں اصل میں "آپ اور ایک جنرل ایجنٹ" ہیں۔ Optional Personal Agent Harnesses bridge بھی اپنا harness انہی tools میں سے کسی ایک کے ذریعے install اور run کرتا ہے۔ اس لیے یہ وہ skill ہے جسے آپ سب سے زیادہ reuse کریں گے۔ بعد میں، یہی جنرل ایجنٹ جسے آپ یہاں چلاتے ہیں، وہی tool بن جاتا ہے جس سے آپ workers بناتے ہیں۔ ٹول وہی، کام بڑا۔

یہ حصہ تین مرحلوں میں

یہ کورسز آپ کو ایک ہی لائن پر آگے لے جاتے ہیں: tool کو ہر لمحہ پکڑ کر چلانے سے، اسے ٹھیک ٹھیک direct کرنے تک، پھر ایسا loop design کرنے تک جو اسے آپ کے لیے چلاتا ہے، اس loop کے harness کو مضبوط بنانے تک، بہت سے loops کو مشترک memory دینے تک، اور آخر میں یہ ناپنے تک کہ کیا ان کے مرکز میں موجود checker واقعی قابل اعتماد ہے۔

General Agents کے راستے کا diagram، بائیں سے دائیں تین stages میں۔ بائیں طرف note دکھاتا ہے کہ آپ Foundations سے آتے ہیں۔ Stage 1، "Drive"، general agent operate کرنا سیکھنا ہے: Claude Code اور OpenCode، یا Cowork اور OpenWork۔ Stage 2، "Direct"، Spec-Driven Development ہے۔ Stage 3، "Delegate the loop"، Loop Engineering ہے۔ آگے کا arrow Modes 1 اور 2 تک جاتا ہے۔ Caption کہتا ہے: پہلے Drive، پھر Direct، پھر Delegate the loop۔

مرحلہ 1: چلانا

جنرل ایجنٹ کو اچھی طرح operate کرنا سیکھیں۔ ہر شخص کچھ install کیے بغیر web سے شروع کرتا ہے؛ پھر اپنی ضرورت کے مطابق installed-tool course کریں، اور باقی tools بعد میں سیکھ لیں۔

  • Web پر جنرل ایجنٹس: یہاں سے شروع کریں، browser میں اور بغیر کسی installation کے۔ جولائی 2026 کی web work surfaces، یعنی Claude Cowork on the web اور ChatGPT Work، پر اپنے پہلے agent کو direct کریں۔ Remote sessions، files کی جگہ، phone پر آنے والی approval، اور کسی بھی agent product کو سمجھنے کے لیے چھ حصوں والا lens سیکھیں۔ چاہے آپ code کر سکتے ہوں یا نہیں، پہلے ہر شخص یہ course کرتا ہے؛ پھر نیچے سے کوئی installed tool منتخب کرتا ہے۔
  • Professionals کے لیے Cowork اور OpenWork: باقی سب کے لیے۔ اسی قسم کا agent، desktop app میں، جو professional work کے لیے بنی ہے (documents، spreadsheets، slides، research)، تاکہ اسے کام پر لگانے کے لیے آپ کو terminal نہ چھونا پڑے۔
  • Open Source LLMs: آپ کا Laptop، آپ کا Server یا Cluster، اور Cloud: coding track کا پہلا پڑاؤ۔ Open models download کرنے کے لیے مفت ہیں، اس لیے اصل سوال یہ ہے کہ انہیں کہاں چلایا جائے۔ یہ course تینوں پیمانوں پر جواب دیتا ہے: اپنے laptop پر Ollama کے ساتھ، اپنی GPU machine پر vLLM کے ذریعے ایک ساتھ پچاس لوگوں کے لیے، اور OpenRouter کے ذریعے cloud میں، جہاں وہ frontier open models موجود ہیں جنہیں کوئی خود host نہیں کر سکتا۔ ایک خیال سب کو جوڑتا ہے: آپ کا agent ایک harness اور بدلے جا سکنے والے brain کا مجموعہ ہے، اور brain صرف ایک address ہے۔ Part 1 الگ سے مکمل ہے اور ایک free install کے سوا کچھ نہیں مانگتا۔ اگر آپ نے coding agent چلایا ہو تو مدد ملے گی، لیکن نہ چلایا ہو تو اس کی one-command installation آپ کے لیے ایک agent کھڑا کر دیتی ہے۔ جن knowledge workers نے Cowork پہلے ہی کر لیا ہے، وہ بھی ذاتی اور private AI کے لیے Part 1 کر سکتے ہیں۔
  • Agentic Coding: Claude Code اور OpenCode: ان لوگوں کے لیے جو code کے ساتھ کام کرتے ہیں۔ Plan mode، context management، rules file، skills، subagents، اور connectors (MCP): coding agent کو کیسے چلائیں تاکہ وہ آپ کی files پڑھے، plan propose کرے، edits کرے، اور آپ کو result check کرنے دے۔
  • Website Design: وہ course جہاں آپ machine کے بارے میں سیکھنا چھوڑ کر اسے ایک حقیقی کام دیتے ہیں۔ ایک client کے لیے ایک website، خالی folder سے ایسے live address تک جسے کوئی دوسرا اپنے phone پر کھول سکے: pixels سے پہلے story کی planning، client کے brand کو mood کے بجائے rule سمجھنا، حقیقی photos اور video، phone version کو بعد کی سوچ نہ بنانا، اور screenshots کو tests کے طور پر استعمال کرنا تاکہ «کیا یہ درست دکھتا ہے؟» واقعی قابل جانچ سوال بن جائے۔ اس کا مرکزی خیال Stage 2 اور Stage 3 میں بار بار کام آتا ہے: ذوق اب ایک file ہے۔ بنائے گئے page اور generated page کے درمیان فرق پیدا کرنے والی judgment لکھی جا سکتی ہے، اور کوئی بھی model اسے load کر سکتا ہے۔ اوپر کے دونوں tools میں سے کوئی چلا سکنے کے بعد یہ course کریں؛ کچھ ship کرنے اور کام کی خرابی محسوس کرنے کے بعد specs اور loops کی اہمیت سمجھنا بہت آسان ہوتا ہے۔

مرحلہ 2: direct کرنا

چلانے سے result ملتا ہے؛ direct کرنے سے ہر بار درست result ملتا ہے۔

  • Spec-Driven Development: agent کو vague instructions دینا بند کریں اور اسے لکھی ہوئی spec دیں: exactly کیا کرنا ہے، کس چیز پر کرنا ہے، اور "done" کا مطلب کیا ہے۔ صاف spec وہ فرق ہے جو guessing agent اور target hit کرنے والے agent کے درمیان ہوتا ہے، اور Mode 2 میں cross کرتے وقت یہی پہلی چیز آپ ساتھ لے جاتے ہیں۔

مرحلہ 3: loop delegate کرنا

یہ مرحلہ ایک نقشے سے شروع ہوتا ہے، پھر نقشے میں نام دی ہوئی چیزیں بناتا ہے: loop ڈیزائن کریں، اس کے چلنے والے harness کو مضبوط کریں، بہت سے loops کو ایک مشترک memory دیں، پھر evals سے ثابت کریں کہ درمیان کا checker قابل اعتماد ہے۔ آخری course اس سوال کا جواب دیتا ہے جو یہ سب اٹھاتے ہیں: جب loop قابل اعتماد ہو جائے تو اسے کہاں رہنا چاہیے؟

  • چار تہیں: اسے پہلے پڑھیں، اور ایک گھنٹے سے کم وقت میں پڑھیں۔ یہ آگے آنے والی ہر چیز کا نقشہ ہے: prompt، context، harness اور loop چار الگ مہارتیں نہیں جن میں سے آپ ایک منتخب کریں، بلکہ چار containers ہیں، ہر ایک اگلے کے اندر اور ہر ایک کی اپنی unit of work ہے۔ اصل فائدہ technique نہیں بلکہ ایک عادت ہے۔ جب agent چالیس منٹ اور پچاس ڈالر ایک ہی کام دہرانے میں خرچ کرے تو آپ prompt دوبارہ لکھنا چھوڑ دیتے ہیں، جسے دس سیکنڈ میں بدل سکتے ہیں، اور پوچھتے ہیں کہ اصل میں کون سی تہہ ٹوٹی۔ یہ یہ بھی طے کرتا ہے کہ graphs کہاں آتے ہیں: پانچویں تہہ کے طور پر نہیں۔ کچھ install کرنے کی ضرورت نہیں؛ ایک chat tab اور ایک agent جسے آپ پہلے چلا چکے ہیں، یہی مکمل setup ہے۔

  • Loop Engineering: tool کو ہاتھ میں پکڑے رکھنے سے ایسے system design کرنے تک کی چھلانگ جو agent کو آپ کے لیے prompt کرتا ہے۔ آپ ایک چھوٹا loop بناتے ہیں جو wake up کرتا ہے، دیکھتا ہے کیا بدلا، طے کرتا ہے کیا کرنے کے قابل ہے، ہر job agent کو دیتا ہے، result check کرتا ہے، اور صرف ان decisions کے لیے آپ کو بلاتا ہے جنہیں واقعی انسان کی ضرورت ہے۔ Valuable skill آپ کے لکھے prompt سے ہٹ کر آپ کے design کیے ہوئے loop میں آ جاتی ہے۔ یہی آگے کی ہر چیز کا natural doorway ہے۔

  • Harness Engineering: اسی چھلانگ کا trust والا حصہ۔ نیند کے دوران چلنے والے loop کو ایک ایسی تہہ چاہیے جو طے کرے کہ agent کیا کر سکتا ہے، اسے کیا جاننا چاہیے، اس کے کام کا ثبوت کیسے ملے گا، اور خرابی پر کیا ہوگا۔ یہی تہہ harness ہے، اور Claude Code اور OpenCode دونوں اپنا harness دیتے ہیں۔ یہ course permission walls، sandboxes، خودکار جانچیں، اور ہر پکڑی گئی غلطی کو ایسے مستقل rule میں بدلنے کی عادت سکھاتا ہے جو اسے دوبارہ ناممکن بنائے۔

  • Graph Engineering: memory والا حصہ، اور وہ course جو ایک loop ناکافی ہونے پر کرنا چاہیے۔ بیس agents پھیلا دیں تو ہر agent خالی شروع کرتا ہے اور وہ بات دوبارہ دریافت کرتا ہے جو دوسرا ایک گھنٹہ پہلے جان چکا تھا: کام بڑھا، memory نہیں۔ حل یہ ہے کہ findings کو مر جانے والی transcripts میں چھوڑنے کے بجائے typed اور connected records کی شکل میں لکھا جائے جن سے بعد کا ہر agent سوال کر سکے۔ ایجنٹ بھول جاتا ہے، graph نہیں بھولتا۔ کام اور ثابت شدہ facts کے لیے دو الگ graphs رکھیں، ہر claim کے ساتھ ثبوت جوڑیں، ہر worker کو data dump کے بجائے محدود حصہ دیں، اور reviewer سے رائے کے بجائے edge کا حوالہ مانگیں۔ آخری حصہ loops کو آپس میں جوڑتا ہے: کون کس کو check کرتا ہے، کس کا target کس کی ملکیت ہے، اور کن measurements پر کسی loop کو بحث کی اجازت نہیں۔ اپنا دوسرا loop بناتے وقت اسے پڑھیں، اور یہ ایمانداری سے یہ بھی بتاتا ہے کہ graph کب نہیں بنانا چاہیے۔

  • Checker پر اعتماد: loop چلتا ہے، harness کام ثابت کرتا ہے، اور مرکز میں checker PASS یا FAIL کہتا ہے۔ مگر آپ کیسے جانیں کہ checker اچھا ہے؟ یہ course evals سکھاتا ہے: حقیقی failures سے test cases کا چھوٹا folder بنائیں، reviewer کو ایک بار کے بجائے کئی بار grade کریں، اپنے فیصلے کے مقابل اسے calibrate کریں، اور ہر تبدیلی کو نتیجے سے gate کریں۔ صرف files، shell، اور jq سے «checker نے PASS کہا» ایک ایسے عدد میں بدل جاتا ہے جس کا آپ دفاع کر سکتے ہیں۔

  • Laptop سے باہر: runtime کا فیصلہ۔ Laptop پر ثابت شدہ loop ایک ہی machine میں قید ہے۔ یہ course اسے ایسی جگہ منتقل کرتا ہے جہاں وہ واقعی چل سکے، چاہے cloud schedule ہو، managed runtime ہو، یا آپ کا اپنا process، اور اس دوران اس کی کمائی ہوئی track record محفوظ رہتی ہے۔ اس سے Stage 3 مکمل ہوتا ہے: loop چل رہا ہے، harness حفاظت کر رہا ہے، checker قابل اعتماد ہے، اور اب وہ ایسی جگہ رہتا ہے جو آپ کے سونے پر نہیں سوتی۔

چار الفاظ، ہر ایک اگلے کے اندر

اوپر کے تین مراحل میں چار الفاظ آتے ہیں جنہیں صنعت مسلسل خلط ملط کرتی ہے: prompt، context، harness، اور loop۔ یہ ان کی شکل ہے، تاکہ آپ دیکھ سکیں کہ کون سا course کس کا ذمہ دار ہے۔ چار تہیں وہ course ہے جو تقریبا پچاس منٹ میں اسے درست طور پر سکھاتا ہے، اور مرحلہ 3 میں سب سے پہلے یہی پڑھنا چاہیے۔

«چار الفاظ، ہر ایک اگلے کے اندر» کے عنوان والا diagram، جس میں چار اندرونی rounded boxes ہیں۔ سب سے اندر slate box layer 1، prompt ہے: آپ کا بھیجا ہوا message، یعنی ask، examples، اور format؛ اس کا course AI Prompting in 2026 ہے۔ اس کے گرد gold box layer 2، context ہے: ایک response کے لیے model کی دیکھی ہوئی ہر چیز؛ اس کا course Agentic Coding کے Parts 2 سے 4 ہیں۔ اس کے گرد terracotta box layer 3، harness ہے: ایک run کے اندر permissions، checks، اور recovery؛ اس کا course Harness Engineering ہے۔ سب سے باہر slate box layer 4، loop ہے: وہ schedule جو runs شروع کرتا، انہیں grade کرتا، اور ان کے بیچ یاد رکھتا ہے؛ اس کا course Loop Engineering ہے۔ نیچے bar کہتا ہے: خراب context کے اندر اچھا prompt ناکام ہوتا ہے، bare harness کے اندر اچھا context ناکام ہوتا ہے، اور loop کے بغیر اچھا harness بے کار بیٹھا رہتا ہے؛ زیادہ تر online تحریر layers 3 اور 4 کو ایک ہی قلم سے بناتی ہے، جبکہ یہ کتاب انہیں الگ رکھتی ہے کیونکہ ان کی failures مختلف ہیں۔

لفظیہ کیا ہےکام کی اکائیاس کا مالک course
Promptآپ کا بھیجا ہوا message: ask، examples، اور format۔ایک messageAI Prompting in 2026
Contextایک response کے لیے model کی دیکھی ہوئی ہر چیز: files، history، rules، اور tool results۔ہر قدم پر window میں رہنے والی چیزAgentic Coding، Parts 2–4
Harnessایک run کے اندر rules: agent کیا کر سکتا ہے، اس کے کام کا ثبوت کیسے ملتا ہے، اور failure پر کیا ہوتا ہے۔ایک runHarness Engineering
Loopہر چیز کے گرد schedule: runs شروع کرتا، انہیں grade کرتا، اور ان کے بیچ یاد رکھتا ہے۔کئی دنوں میں بہت سے runsLoop Engineering

یہ چار کسی line کے steps نہیں، بلکہ ایک دوسرے کے اندر layers ہیں۔ خراب context کے اندر اچھا prompt ناکام ہوتا ہے۔ خالی harness کے اندر اچھا context ناکام ہوتا ہے۔ اچھا harness اسے چلانے والے loop کے بغیر بے کار بیٹھا رہتا ہے۔ اسی لیے demo میں کام کرنے والا agent اکثر production میں مر جاتا ہے: demo کو صرف اندرونی layers چاہیے تھیں اور بیرونی layers کبھی بنیں ہی نہیں۔ مسئلہ model نہیں تھا۔ اس کے گرد layers غائب تھیں۔

اس حصے کا ایک course ان چاروں میں سے کسی کا ذمہ دار نہیں، اور یہ جان بوجھ کر ہے۔ Graph Engineering پانچویں تہہ نہیں بلکہ ایک topology ہے: ایسے بہت سے stacks جو آپس میں جڑے ہوں اور ایک memory بانٹتے ہوں۔ وہ table سے باہر ہے کیونکہ جب تک آپ ایک سے زیادہ loop نہ چلا رہے ہوں، یہ لفظ کوئی فائدہ نہیں دیتا۔ اسی لیے وہ چاروں کے بعد آتا ہے۔

اچھا prompt آپ کو ذہین جواب دیتا ہے۔ چاروں تہیں مل کر ایسی چیز دیتی ہیں جسے آپ ship کر سکتے ہیں۔ چار تہیں ہر تہہ کو الگ کرتا ہے، ہر ایک کی failure signature دیتا ہے، اور «میرا agent خراب ہے» کو ایسے سوال میں بدلتا ہے جس کا ایک پتہ ہو۔

پہلے آپ کو کیا چاہیے

پہلے Foundations والا حصہ کریں، خاص طور پر AI کے دور میں سوچنے کا طریقہ (اپنی judgment قائم رکھنا) اور Skills اور Connectors (وہ plugins جن سے general agent آپ کے tools اور data تک پہنچتا ہے)۔ آپ کو programmer ہونا ضروری نہیں: اگر آپ نہیں ہیں تو Cowork اور OpenWork والا دروازہ لیں اور آپ ٹھیک رہیں گے۔

یہ کہاں لے جاتا ہے

جب آپ جنرل ایجنٹ کو drive، direct، loop، اور مضبوط بنا سکتے ہیں، تو باقی کتاب کھل جاتی ہے۔ Optional Personal Agent Harnesses والا حصہ بس آگے ہے، اگر آپ ایسا worker own کرنا چاہتے ہیں جو آپ کی اپنی infrastructure پر چلتا ہے۔ پھر وہ fork آتا ہے جس پر پوری کتاب گھومتی ہے: مسئلہ حل کرنا — Mode 1، جہاں آپ ایک مسئلہ ایک بار حل کرنے کے لیے general agent استعمال کرتے ہیں، اور مینوفیکچرنگ — Mode 2، جہاں آپ permanent worker بناتے ہیں جو اسے ہمیشہ solve کرتا ہے۔

کتاب کا arc ایک سطر میں: Foundations سے سمجھنا، جنرل ایجنٹس سے چلانا، اور دونوں modes سے AI کو کام میں لگانا۔

Browser میں Web پر جنرل ایجنٹس سے شروع کریں۔ ہر شخص پہلے دن، کچھ install کیے بغیر یہ کر سکتا ہے۔ پھر agent کو اپنی machine پر لاتے وقت اپنی ضرورت کا دروازہ چنیں: اگر آپ code کے ساتھ کام کرتے ہیں تو Claude Code اور OpenCode، اگر نہیں کرتے تو Cowork اور OpenWork۔