جائزہ / ڈیٹا
مجموعے کا ورژن: 210 اندراجات · 2026-09-06
ڈیٹا
اس سائٹ کا ہر عدد نیچے دی گئی فائلوں سے شمار ہوتا ہے۔ یہ اس لیے شائع کی گئی ہیں کہ جسے کسی عدد پر شبہ ہو وہ اُسے خود دوبارہ نکال سکے، اور جو اس مطالعے کو آگے بڑھانا چاہے اُسے پہلے پوری فہرست دوبارہ نہ بنانی پڑے۔
ڈاؤن لوڈ
| فائل | کیا شامل ہے | شکل |
|---|---|---|
| data.json | سب کچھ: 210 فہرستی اندراج درجوں اور شہادت کے ساتھ، 46 نتائج، سات پیمانوں کی تعریفیں، اور تشریحی کتابیات۔ | JSON |
| data.csv | فہرست ایک سادہ جدول کی صورت — فی کتاب ایک سطر، فی پیمانہ ایک خانہ۔ اسپریڈ شیٹ کے لیے۔ | CSV |
/books/<id>.json | ایک اکیلا اندراج، مثلاً kptbb-physics-10-en.json۔ ہر کتاب کے صفحے کا ایک ایسا پتہ بھی ہے، اُسی پتے کے ساتھ .json لگا کر۔ | JSON |
اجازت نامہ
یہ منصوبہ جو کچھ بناتا ہے وہ سب CC BY 4.0 کے تحت ہے۔ استعمال کیجیے، نقل کیجیے، دوبارہ شائع کیجیے، تجارتی طور پر اس پر تعمیر کیجیے — بس Textbook Evidence Project کا حوالہ دیجیے اور واپس ربط دیجیے تاکہ پڑھنے والا وہ ورژن دیکھ سکے جو آپ نے استعمال کیا۔
درسی کتابوں کی PDF فائلیں شامل نہیں اور نہ ہی اُن پر اجازت دینا ہمارا حق ہے۔ اُن پر شائع کرنے والے بورڈوں کی صریح شرائط ہیں۔ ہر اندراج کے ساتھ کتابیاتی تفصیل اور اُس ماخذ کا ربط ہے جہاں سے ہمیں وہ ملی، تاکہ آپ اصل چیز خود حاصل کر سکیں۔ یہ فرق پورا کا پورا تعارف میں بیان ہوا ہے۔
آپ کو کیا مل رہا ہے، اور یہ کس بات کی تائید نہیں کرے گا
| فہرست کے اندراجات | 210 — 167 موجودہ، 43 تاریخی |
|---|---|
| کم از کم ایک درجہ رکھنے والی | 137 (تاریخی ایڈیشن کبھی نہیں پرکھے جاتے) |
| نتائج | 46 |
| مجموعے کا ورژن | 210 اندراج، 2026-09-06 کو تیار ہوئے |
- درجے پیمائشیں ہیں، فیصلے نہیں۔ ہر پیمانہ 1 سے 5 تک چلتا ہے اور 1 غیر مذہبی، تکثیری یا کھلا سرا ہے۔ بڑا عدد کسی متن کی ایک خاصیت درج کرتا ہے؛ یہ کسی بورڈ، مصنف یا استاد پر فیصلہ نہیں۔
- کوئی بھی اوسط نقل کرنے سے پہلے تعداد دیکھ لیجیے۔ پیمانوں کا احاطہ جان بوجھ کر یکساں نہیں — ہر پہلو نے وہی کتابیں پرکھیں جہاں اُس کا سوال زندہ تھا۔ کچھ بورڈوں کے لیے A4 صرف ایک کتاب پر کھڑا ہے اور اسے بورڈ کا عدد بنا کر نقل نہیں کرنا چاہیے۔ پیمانوں کے صفحات ہر بنیاد چھاپتے ہیں۔
- اردو یا سندھی اندراجات سے کچھ اقتباس کے قابل نہیں۔ وہ استخراج موضوعاتی درجے کے ہیں: ساخت، ابواب کے احاطے اور اسمِ معرفہ کے لیے اچھے، الفاظ کے لیے کبھی نہیں۔ استخراج شدہ متن کا تقریباً چوتھائی حصہ یہاں آتا ہے۔
- تاریخی اندراج موجودہ اندراجات سے قابلِ موازنہ نہیں۔ وہ تبدیلی درج کرنے کے لیے فہرست میں رکھے گئے ہیں اور ڈیزائن ہی سے اُن پر کوئی درجہ نہیں۔
acquiredکی تاریخ مقامی طور پر حاصل کرنے کی تاریخ ہے، کسی باقاعدہ ویب آرکائیو کی محفوظ نقل کی نہیں۔ ماخذ کے روابط ٹوٹ جاتے ہیں؛ کتاب کی شناخت اُس کا کتابیاتی اندراج کرتا ہے۔ ہر اندراج کے ساتھ تجزیہ شدہ فائل کاsha256بھی ہے، تاکہ آپ تصدیق کر سکیں کہ آپ بعینہٖ اُنہی بائٹس پر کام کر رہے ہیں۔
یہ مطالعہ نئے سرے سے کیسے دہرایا جائے
پائپ لائن شیل اور پائتھون کی چند اسکرپٹیں ہیں، اور یہ اس کے سوا ہر لحاظ سے یقینی ہے کہ بورڈ آپ کے نیچے سے کتاب دوبارہ چھاپ دیں۔ ترتیب یہ ہے: درج شدہ ماخذ کے پتوں سے حاصل کرنا، ابتدائی بائٹس اور آخری حصے کی جانچ کے ساتھ؛ ہر کتاب کا ذریعۂ تعلیم فائل کے نام سے نہیں بلکہ تجرباتی طور پر طے کرنا؛ جہاں ناشر کا اپنا متن موجود ہو وہاں اصل متن نکالنا؛ باقی کو 300 dpi پر زبان کے مخصوص ماڈلوں سے OCR کرنا؛ فہرستِ اجزا دوبارہ بنانا؛ ڈیٹا مرتب کرنا؛ اور پھر سائٹ بنانا، جو اپنا سارا مواد تجزیے کی ڈائریکٹری سے نئے سرے سے تیار کرتی ہے۔
خود پائپ لائن
سادہ متن کے طور پر پیش کی گئی ہیں تاکہ براؤزر ہی میں پڑھی جا سکیں۔ یہ بعینہٖ وہی اسکرپٹیں ہیں جنہوں نے اوپر کی ہر چیز بنائی۔
| شے | یہ کیا کرتی ہے |
|---|---|
| download.sh | حصول۔ ابتدائی بائٹس اور فائل کے آخری حصے، دونوں کی تصدیق کرتی ہے، کیونکہ اس منصوبے میں ایک ماخذ نے ایک بظاہر مکمل فائل کے بیچ دھارے میں HTML کا غلطی والا صفحہ جوڑ دیا تھا۔ |
| detect_medium.sh | ہر کتاب کا ذریعۂ تعلیم فائل کے نام پر بھروسا کرنے کے بجائے تجرباتی طور پر طے کرتی ہے۔ |
| extract_text.sh | جہاں ناشر کا اپنا متن موجود ہو وہاں اصل متن۔ |
| ocr.sh | 300 dpi پر تصویر کشی اور زبان کے مخصوص ماڈلوں سے OCR۔ ایسی کتاب پر چلنے سے انکار کرتی ہے جس کا ذریعۂ تعلیم طے نہ ہو، اور 200 حروف سے کم استخراج لکھنے سے بھی۔ |
| build_manifest.sh | فہرستِ اجزا: فی PDF صفحات، بنانے والا، اور متن نکالے جانے کی صلاحیت۔ |
| build_dataset.py | ڈیٹا مرتب کرتی ہے — دور کی جدول، پہلوؤں کی جدولوں سے درجوں کی پڑھت، شہادت کی درجہ بندی، اور چیک سم۔ |
| sync_site.sh · sync_studies.py | سائٹ جو کچھ پڑھتی ہے وہ سب تجزیے کی ڈائریکٹری سے نئے سرے سے بناتی ہیں، تاکہ دونوں ایک دوسرے سے ہٹ نہ جائیں۔ |
| check_numbers.py · check_citations.py | تعمیر کے وقت کے پہرے دار۔ پہلی اُس عدد پر تعمیر روک دیتی ہے جو ڈیٹا سے نکالنے کے بجائے صفحے کی عبارت میں لکھ دیا گیا ہو؛ دوسری اُس وقت روکتی ہے جب کوئی ترجمہ شدہ متن وہ صفحہ وار حوالہ گرا دے جو اصل میں موجود ہے۔ |
| mark_ltr.py | تعمیر کے بعد اردو ایڈیشن میں لاطینی رسم الخط کے حصوں کو بائیں سے دائیں نشان زد کرتی ہے، تاکہ دائیں سے بائیں صفحے پر انگریزی عبارت جوں کی توں پڑھی جائے، الٹ پلٹ کر نہیں۔ |
| README · ادارتی ہدایت نامہ · پتوں کی پالیسی | وہ تحریری اصول جن کا یہ منصوبہ خود پابند ہے، بشمول شناختی نمبروں کے نظام کے۔ |
چلانے سے پہلے دو ناکامیوں کا جاننا ضروری ہے۔ کوئی PDF مکمل دکھائی دینے والی فائل ہو کر بھی ادھوری ہو سکتی ہے — اس منصوبے میں ایک ماخذ نے بیچ دھارے میں ایک HTML کا غلطی والا صفحہ جوڑ دیا تھا — اس لیے مکمل ہونے کی تصدیق صفحات کے شجرے کو پڑھ کر کی جاتی ہے، فائل کے حجم سے کبھی نہیں۔ اور OCR اُس کتاب پر کبھی نہ چلایا جائے جس کا ذریعۂ تعلیم طے نہ ہو، کیونکہ غلط زبان کا ماڈل کھلی ناکامی کے بجائے پُریقین بےمعنی متن پیدا کرتا ہے۔ دونوں جانچیں اسکرپٹوں میں موجود ہیں۔
ڈیٹا کا حوالہ
مجموعے کا ورژن ضرور لکھیے۔ فہرست بڑھتی رہتی ہے اور نتائج پر نظرِ ثانی ہوتی رہتی ہے؛ ورژن کے بغیر حوالے کو اُس چیز سے ملایا نہیں جا سکتا جو آپ نے واقعی پڑھی۔