English

جائزہ / ڈیٹا

مجموعے کا ورژن: 210 اندراجات · 2026-09-06

ڈیٹا

اس سائٹ کا ہر عدد نیچے دی گئی فائلوں سے شمار ہوتا ہے۔ یہ اس لیے شائع کی گئی ہیں کہ جسے کسی عدد پر شبہ ہو وہ اُسے خود دوبارہ نکال سکے، اور جو اس مطالعے کو آگے بڑھانا چاہے اُسے پہلے پوری فہرست دوبارہ نہ بنانی پڑے۔

ڈاؤن لوڈ

فائلکیا شامل ہےشکل
data.jsonسب کچھ: 210 فہرستی اندراج درجوں اور شہادت کے ساتھ، 46 نتائج، سات پیمانوں کی تعریفیں، اور تشریحی کتابیات۔JSON
data.csvفہرست ایک سادہ جدول کی صورت — فی کتاب ایک سطر، فی پیمانہ ایک خانہ۔ اسپریڈ شیٹ کے لیے۔CSV
/books/<id>.jsonایک اکیلا اندراج، مثلاً kptbb-physics-10-en.json۔ ہر کتاب کے صفحے کا ایک ایسا پتہ بھی ہے، اُسی پتے کے ساتھ .json لگا کر۔JSON

اجازت نامہ

یہ منصوبہ جو کچھ بناتا ہے وہ سب CC BY 4.0 کے تحت ہے۔ استعمال کیجیے، نقل کیجیے، دوبارہ شائع کیجیے، تجارتی طور پر اس پر تعمیر کیجیے — بس Textbook Evidence Project کا حوالہ دیجیے اور واپس ربط دیجیے تاکہ پڑھنے والا وہ ورژن دیکھ سکے جو آپ نے استعمال کیا۔

درسی کتابوں کی PDF فائلیں شامل نہیں اور نہ ہی اُن پر اجازت دینا ہمارا حق ہے۔ اُن پر شائع کرنے والے بورڈوں کی صریح شرائط ہیں۔ ہر اندراج کے ساتھ کتابیاتی تفصیل اور اُس ماخذ کا ربط ہے جہاں سے ہمیں وہ ملی، تاکہ آپ اصل چیز خود حاصل کر سکیں۔ یہ فرق پورا کا پورا تعارف میں بیان ہوا ہے۔

آپ کو کیا مل رہا ہے، اور یہ کس بات کی تائید نہیں کرے گا

فہرست کے اندراجات210 — 167 موجودہ، 43 تاریخی
کم از کم ایک درجہ رکھنے والی137 (تاریخی ایڈیشن کبھی نہیں پرکھے جاتے)
نتائج46
مجموعے کا ورژن210 اندراج، 2026-09-06 کو تیار ہوئے

یہ مطالعہ نئے سرے سے کیسے دہرایا جائے

پائپ لائن شیل اور پائتھون کی چند اسکرپٹیں ہیں، اور یہ اس کے سوا ہر لحاظ سے یقینی ہے کہ بورڈ آپ کے نیچے سے کتاب دوبارہ چھاپ دیں۔ ترتیب یہ ہے: درج شدہ ماخذ کے پتوں سے حاصل کرنا، ابتدائی بائٹس اور آخری حصے کی جانچ کے ساتھ؛ ہر کتاب کا ذریعۂ تعلیم فائل کے نام سے نہیں بلکہ تجرباتی طور پر طے کرنا؛ جہاں ناشر کا اپنا متن موجود ہو وہاں اصل متن نکالنا؛ باقی کو 300 dpi پر زبان کے مخصوص ماڈلوں سے OCR کرنا؛ فہرستِ اجزا دوبارہ بنانا؛ ڈیٹا مرتب کرنا؛ اور پھر سائٹ بنانا، جو اپنا سارا مواد تجزیے کی ڈائریکٹری سے نئے سرے سے تیار کرتی ہے۔

خود پائپ لائن

سادہ متن کے طور پر پیش کی گئی ہیں تاکہ براؤزر ہی میں پڑھی جا سکیں۔ یہ بعینہٖ وہی اسکرپٹیں ہیں جنہوں نے اوپر کی ہر چیز بنائی۔

شےیہ کیا کرتی ہے
download.shحصول۔ ابتدائی بائٹس اور فائل کے آخری حصے، دونوں کی تصدیق کرتی ہے، کیونکہ اس منصوبے میں ایک ماخذ نے ایک بظاہر مکمل فائل کے بیچ دھارے میں HTML کا غلطی والا صفحہ جوڑ دیا تھا۔
detect_medium.shہر کتاب کا ذریعۂ تعلیم فائل کے نام پر بھروسا کرنے کے بجائے تجرباتی طور پر طے کرتی ہے۔
extract_text.shجہاں ناشر کا اپنا متن موجود ہو وہاں اصل متن۔
ocr.sh300 dpi پر تصویر کشی اور زبان کے مخصوص ماڈلوں سے OCR۔ ایسی کتاب پر چلنے سے انکار کرتی ہے جس کا ذریعۂ تعلیم طے نہ ہو، اور 200 حروف سے کم استخراج لکھنے سے بھی۔
build_manifest.shفہرستِ اجزا: فی PDF صفحات، بنانے والا، اور متن نکالے جانے کی صلاحیت۔
build_dataset.pyڈیٹا مرتب کرتی ہے — دور کی جدول، پہلوؤں کی جدولوں سے درجوں کی پڑھت، شہادت کی درجہ بندی، اور چیک سم۔
sync_site.sh · sync_studies.pyسائٹ جو کچھ پڑھتی ہے وہ سب تجزیے کی ڈائریکٹری سے نئے سرے سے بناتی ہیں، تاکہ دونوں ایک دوسرے سے ہٹ نہ جائیں۔
check_numbers.py · check_citations.pyتعمیر کے وقت کے پہرے دار۔ پہلی اُس عدد پر تعمیر روک دیتی ہے جو ڈیٹا سے نکالنے کے بجائے صفحے کی عبارت میں لکھ دیا گیا ہو؛ دوسری اُس وقت روکتی ہے جب کوئی ترجمہ شدہ متن وہ صفحہ وار حوالہ گرا دے جو اصل میں موجود ہے۔
mark_ltr.pyتعمیر کے بعد اردو ایڈیشن میں لاطینی رسم الخط کے حصوں کو بائیں سے دائیں نشان زد کرتی ہے، تاکہ دائیں سے بائیں صفحے پر انگریزی عبارت جوں کی توں پڑھی جائے، الٹ پلٹ کر نہیں۔
README · ادارتی ہدایت نامہ · پتوں کی پالیسیوہ تحریری اصول جن کا یہ منصوبہ خود پابند ہے، بشمول شناختی نمبروں کے نظام کے۔

چلانے سے پہلے دو ناکامیوں کا جاننا ضروری ہے۔ کوئی PDF مکمل دکھائی دینے والی فائل ہو کر بھی ادھوری ہو سکتی ہے — اس منصوبے میں ایک ماخذ نے بیچ دھارے میں ایک HTML کا غلطی والا صفحہ جوڑ دیا تھا — اس لیے مکمل ہونے کی تصدیق صفحات کے شجرے کو پڑھ کر کی جاتی ہے، فائل کے حجم سے کبھی نہیں۔ اور OCR اُس کتاب پر کبھی نہ چلایا جائے جس کا ذریعۂ تعلیم طے نہ ہو، کیونکہ غلط زبان کا ماڈل کھلی ناکامی کے بجائے پُریقین بےمعنی متن پیدا کرتا ہے۔ دونوں جانچیں اسکرپٹوں میں موجود ہیں۔

ڈیٹا کا حوالہ

Textbook Evidence Project, Pakistan Provincial Textbook Evidence Corpus, corpus version 210 records, 2026-09-06. CC BY 4.0. Retrieved from /data.json

مجموعے کا ورژن ضرور لکھیے۔ فہرست بڑھتی رہتی ہے اور نتائج پر نظرِ ثانی ہوتی رہتی ہے؛ ورژن کے بغیر حوالے کو اُس چیز سے ملایا نہیں جا سکتا جو آپ نے واقعی پڑھی۔

← یہ ڈیٹا کیسے بنا · تصحیحات کا اندراج ←