یادگیری ماشین
Machine learningیادگیری ماشین جادو نیست؛ بهینهسازی آماری است. مدل چیزی را یاد میگیرد که در داده هست — از جمله سوگیریهایی که نمیخواستی. این مسیر بیشتر وقتش را روی داده و ارزیابی میگذارد، نه روی الگوریتم، چون در پروژهٔ واقعی همانجاست که کار برنده یا بازنده میشود.
پیشرفت تو
درصد هر فصل از دو چیز میآید: چقدر از بخشهایش را خواندهای (۵۵٪) و چند تمرینش را تیک زدهای (۴۵٪). همهچیز داخل مرورگر خودت میماند.
فصل
فصلها به هم وابستهاند و ترتیبشان معنا دارد. هر مسیر با پروژههای نهایی تمام میشود: ساده، متوسط، پیچیده.
یادگیری ماشین چیست
نظارتشده، بینظارت، تقویتی — و کِی اصلاً لازم نیست.
در نوبت نوشتنابزار کار
Python، NumPy، pandas و Jupyter.
در نوبت نوشتنداده: مهمترین بخش
پاکسازی، مقدار گمشده، outlier و نشت داده.
در نوبت نوشتنمهندسی ویژگی
مقیاسدهی، رمزگذاری دستهای و ساخت ویژگی.
در نوبت نوشتنرگرسیون خطی
سادهترین مدل، و اینکه چقدر میشود ازش یاد گرفت.
در نوبت نوشتنرگرسیون لجستیک
طبقهبندی، احتمال و مرز تصمیم.
در نوبت نوشتنارزیابی مدل
accuracy کافی نیست: precision، recall، F1، ROC.
در نوبت نوشتنoverfitting و اعتبارسنجی
train/test، cross-validation و منظمسازی.
در نوبت نوشتندرخت تصمیم و جنگل
قابل تفسیر، قوی و پرکاربرد.
در نوبت نوشتنboosting
XGBoost و LightGBM: برندهٔ بیشتر مسائل جدولی.
در نوبت نوشتنSVM و k-NN
مرز و همسایگی.
در نوبت نوشتنخوشهبندی
k-means، DBSCAN و ارزیابی بدون برچسب.
در نوبت نوشتنکاهش بعد
PCA و t-SNE برای دیدن داده.
در نوبت نوشتندادهٔ نامتوازن
وقتی ۹۹٪ کلاس منفی است.
در نوبت نوشتنتنظیم ابرپارامتر
grid، random و Bayesian.
در نوبت نوشتنpipeline و بازتولیدپذیری
یک خط لولهٔ کامل، قابل تکرار.
در نوبت نوشتناستقرار مدل
API، نسخهگذاری مدل، و drift.
در نوبت نوشتنسوگیری و اخلاق
مدلی که تبعیض یاد گرفته، و مسئولیت تو.
در نوبت نوشتنپروژهٔ ۱ — پیشبینی قیمت
رگرسیون کامل با ارزیابی درست.
در نوبت نوشتنپروژهٔ سادهپروژهٔ ۲ — طبقهبندی با دادهٔ کثیف
پاکسازی، ویژگی، نامتوازنی و تفسیر.
در نوبت نوشتنپروژهٔ متوسطپروژهٔ ۳ — مدل در production
خط لوله، API، مانیتورینگ و بازآموزی.
در نوبت نوشتنپروژهٔ پیچیده