مدرس:
هزینه سفارش:
۴۰۰,۰۰۰ تومان قیمت اصلی: ۴۰۰,۰۰۰ تومان بود.۲۱۰,۰۰۰ تومانقیمت فعلی: ۲۱۰,۰۰۰ تومان.
اطلاعات متقابل معیاری از نظریه اطلاعات است که میزان وابستگی آماری میان دو متغیر تصادفی را اندازهگیری میکند. در مسئله دستهبندی متن، این دو متغیر معمولاً عبارتاند از:
برای مثال، در یک سامانه دستهبندی اخبار به دو گروه «ورزشی» و «اقتصادی»، واژههایی مانند «گل»، «تیم»، «مربی» و «مسابقه» ممکن است وابستگی زیادی به کلاس ورزشی داشته باشند. در مقابل، واژههایی مانند «بورس»، «تورم»، «سرمایه» و «سهام» میتوانند برای تشخیص متون اقتصادی مفید باشند.
هرچه وابستگی یک واژه با یک کلاس بیشتر باشد، مقدار Mutual Information آن نیز بیشتر خواهد بود. بنابراین، این روش میتواند واژههای کماهمیت، عمومی یا غیرمرتبط را از مجموعه ویژگیها حذف کرده و بر ویژگیهای مؤثرتر تمرکز کند.
مفهوم اطلاعات متقابل با مفهوم آنتروپی در نظریه اطلاعات ارتباط مستقیم دارد. آنتروپی میزان عدمقطعیت یا ابهام موجود در یک متغیر را نشان میدهد.
اگر با دانستن وضعیت یک واژه، عدمقطعیت ما درباره کلاس یک سند کاهش پیدا کند، آن واژه دارای اطلاعات مفیدی درباره کلاس است. اطلاعات متقابل دقیقاً همین کاهش عدمقطعیت را اندازهگیری میکند.
بهطور ساده:
در متنکاوی، اگر مشاهده واژهای مانند «فوتبال» احتمال ورزشی بودن یک خبر را بهطور قابلتوجهی افزایش دهد، این واژه اطلاعات متقابل بالایی با کلاس ورزشی خواهد داشت.
در مسائل متنکاوی، هر واژه، عبارت یا ویژگی استخراجشده از سند میتواند بهعنوان یک بُعد در فضای ویژگی در نظر گرفته شود. از آنجا که تعداد واژههای موجود در مجموعهای از اسناد ممکن است بسیار زیاد باشد، با مسئلهای به نام فضای ویژگی با ابعاد بالا روبهرو هستیم.
وجود ویژگیهای فراوان و غیرمؤثر میتواند مشکلات زیر را ایجاد کند:
انتخاب ویژگی با روشهایی مانند Mutual Information، کمک میکند تا تنها واژهها و ویژگیهای مؤثر برای دستهبندی متن انتخاب شوند.
در متنکاوی، دو مفهوم استخراج ویژگی و انتخاب ویژگی معمولاً در کنار هم استفاده میشوند، اما یکسان نیستند.
استخراج ویژگی به فرآیند تبدیل متن خام به دادهای قابلاستفاده برای الگوریتمهای یادگیری ماشین گفته میشود. برای مثال، پس از پاکسازی متن و توکنسازی، واژههای موجود در اسناد میتوانند به ویژگی تبدیل شوند.
روشهای متداول نمایش متن عبارتاند از:
انتخاب ویژگی مرحلهای است که در آن، از میان تمام ویژگیهای استخراجشده، فقط ویژگیهای مهمتر و مرتبطتر انتخاب میشوند. در روش اطلاعات متقابل، هر واژه بر اساس میزان ارتباط آن با کلاسها امتیازدهی میشود و سپس واژههای دارای امتیاز بالاتر نگه داشته میشوند.
روشهای انتخاب ویژگی بهطور کلی در سه گروه اصلی قرار میگیرند:
روشهای فیلتری پیش از آموزش مدل یادگیری ماشین، ویژگیها را بر اساس معیارهای آماری رتبهبندی میکنند. این روشها معمولاً سریع هستند و به نوع الگوریتم دستهبندی وابستگی زیادی ندارند.
برخی از روشهای فیلتری عبارتاند از:
در روشهای Wrapper، انتخاب ویژگی با ارزیابی عملکرد یک مدل یادگیری ماشین انجام میشود. این روشها میتوانند دقیقتر باشند، اما به دلیل آموزش مکرر مدل، زمانبرتر هستند.
در روشهای Embedded، انتخاب ویژگی در جریان آموزش مدل انجام میشود. برخی مدلهای مبتنی بر درخت و روشهای دارای منظمسازی، میتوانند در این دسته قرار گیرند.
Mutual Information یک روش فیلتری و آماری است؛ زیرا بدون وابستگی به یک مدل دستهبندی مشخص، رابطه میان ویژگیها و برچسب کلاس را ارزیابی میکند.
در این روش، هر ویژگی بهصورت مستقل بررسی میشود. سپس واژهها یا ویژگیها بر اساس امتیاز MI مرتب میشوند و تعداد مشخصی از ویژگیهای برتر برای ساخت مدل دستهبندی انتخاب میشوند.
مزیت مهم این رویکرد آن است که میتوان یکبار ویژگیها را رتبهبندی کرد و سپس ویژگیهای منتخب را برای الگوریتمهای مختلفی مانند موارد زیر استفاده کرد:
فرآیند استفاده از اطلاعات متقابل برای انتخاب ویژگی در دستهبندی متن، معمولاً شامل مراحل زیر است:
در ابتدا، مجموعهای از اسناد برچسبدار تهیه میشود. هر سند باید به یک یا چند کلاس مشخص تعلق داشته باشد.
متن خام معمولاً شامل نویزها و اطلاعات غیرضروری است. در این مرحله، متن برای تحلیل آماده میشود.
برخی عملیات رایج پیشپردازش عبارتاند از:
پس از پیشپردازش، اسناد باید به بردارهای عددی تبدیل شوند. در این مرحله میتوان از نمایش دودویی، فراوانی واژه یا وزندهی TF-IDF استفاده کرد.
برای هر واژه، میزان وابستگی آن با هر کلاس محاسبه میشود. در مسائل چندکلاسه، امتیاز نهایی یک ویژگی میتواند با روشهایی مانند بیشینه امتیاز آن در میان کلاسها یا تجمیع امتیازها تعیین شود.
ویژگیها بر اساس امتیاز اطلاعات متقابل مرتب میشوند. واژههایی که امتیاز بیشتری دارند، رابطه بیشتری با کلاس یا کلاسهای هدف دارند.
در این مرحله، تعداد مشخصی از ویژگیهای برتر، مانند ۵۰۰، ۱۰۰۰ یا ۵۰۰۰ واژه اول، انتخاب میشوند. تعداد ویژگیها معمولاً با ارزیابی عملکرد مدل و اعتبارسنجی تعیین میشود.
ویژگیهای انتخابشده به الگوریتم دستهبندی داده میشوند و عملکرد مدل با معیارهایی مانند دقت، بازخوانی، صحت و امتیاز F1 ارزیابی میشود.
فرض کنید مجموعهای از اخبار در دو کلاس «ورزشی» و «اقتصادی» داریم. واژه «مسابقه» در بخش زیادی از اخبار ورزشی ظاهر میشود و در اخبار اقتصادی کمتر دیده میشود.
در این حالت، مشاهده واژه «مسابقه» میتواند اطلاعات مناسبی درباره ورزشی بودن یک خبر ارائه دهد؛ بنابراین، این واژه امتیاز MI نسبتاً بالایی با کلاس ورزشی خواهد داشت.
در مقابل، واژهای مانند «امروز» ممکن است هم در اخبار ورزشی و هم در اخبار اقتصادی بهطور گسترده استفاده شود. چون وجود این واژه اطلاعات زیادی درباره کلاس سند ارائه نمیکند، معمولاً امتیاز اطلاعات متقابل آن پایینتر است.
روش Mutual Information به دلیل سادگی، سرعت و قابلیت استفاده در مسائل دارای ابعاد بالا، یکی از روشهای محبوب انتخاب ویژگی محسوب میشود.
مزایای مهم این روش عبارتاند از:
با وجود کاربرد فراوان، روش MI دارای محدودیتهایی نیز است که باید هنگام استفاده از آن در نظر گرفته شوند:
برای کاهش برخی از این چالشها، میتوان از حذف واژههای کمتکرار، اعتبارسنجی، انتخاب تعداد مناسب ویژگیها و ترکیب MI با روشهای دیگر استفاده کرد.
مباحث ارائهشده در این آموزش عبارتاند از:
این دوره برای افراد و گروههای زیر مناسب است:
فیلم آموزش استخراج ویژگی از متن با روش اطلاعات متقابل Mutual Information شامل ۲ فایل آموزشی است:
فایل ویدئویی بهصورت فشرده با فرمت RAR ارائه میشود. برای استخراج فایل، میتوانید از نرمافزار WinRAR نسخه ۲۰۱۹ یا نسخههای جدیدتر استفاده کنید.
آموزش استخراج ویژگی از متن با روش اطلاعات متقابل Mutual Information، محصولی کاربردی برای یادگیری انتخاب ویژگی در مسائل متنکاوی و دستهبندی اسناد است.
در این آموزش، مفاهیم پایهای مانند پیشپردازش متن، نمایش اسناد، روشهای انتخاب ویژگی، روشهای فیلتری، آنتروپی و اطلاعات متقابل بررسی میشوند. همچنین، نحوه استفاده از روش MI بر روی یک مجموعهداده بههمراه مثال عملی آموزش داده میشود تا فراگیر بتواند این روش را در پروژههای واقعی خود به کار ببرد.
این محصول توسط گروه پشتیبانی پیاستور تست و بازبینی شده و دارای نشان تضمین کیفیت پیاستور است.
روش اطلاعات متقابل یا Mutual Information یکی از روشهای فیلتری مهم برای انتخاب ویژگی در متنکاوی است. این روش با اندازهگیری وابستگی میان واژهها و کلاسهای هدف، به شناسایی ویژگیهایی کمک میکند که بیشترین ارزش را در دستهبندی اسناد دارند.
استفاده از MI میتواند تعداد ویژگیها را کاهش دهد، سرعت آموزش مدل را افزایش دهد و در بسیاری از مسائل، کیفیت دستهبندی متن را بهبود بخشد. این آموزش با ارائه مفاهیم تئوری و مثال عملی، مسیر مناسبی برای یادگیری و استفاده از روش اطلاعات متقابل در پروژههای متنکاوی فراهم میکند.
اطلاعات متقابل یک معیار آماری در نظریه اطلاعات است که میزان وابستگی میان دو متغیر را اندازهگیری میکند. در متنکاوی، معمولاً برای سنجش ارتباط میان واژهها و کلاسهای اسناد استفاده میشود.
بله. MI یکی از روشهای فیلتری یا آماری انتخاب ویژگی است که ویژگیها را بر اساس میزان ارتباط آنها با کلاس هدف رتبهبندی میکند.
زیرا تعداد واژهها در دادههای متنی معمولاً زیاد است. انتخاب ویژگی باعث کاهش ابعاد داده، کاهش زمان پردازش، حذف واژههای غیرمؤثر و بهبود احتمالی عملکرد مدل دستهبندی میشود.
بله. در مسائل چندکلاسه میتوان امتیاز اطلاعات متقابل هر واژه را برای کلاسهای مختلف محاسبه و سپس آن را با روشهایی مانند بیشینهگیری یا تجمیع امتیازها رتبهبندی کرد.
بله. عملیاتهایی مانند توکنسازی، حذف کلمات توقف، یکسانسازی متن و حذف نویز، میتوانند کیفیت ویژگیهای استخراجشده و نتیجه انتخاب ویژگی را بهبود دهند.
پایه گذار و موسس وب سایت آموزشی پی استور، مدرس دانشگاه فنی و حرفه ای، برنامه نویس و تحلیل گر سیستم، پژوهشگر در حوزه الگوریتم های ابتکاری، فرا ابتکاری، یادگیری ماشین، شبکه و پایگاه داده. ایشان در زبان های برنامه نویسی متعدد، نظیر ++C، سی شارپ، PHP ،Java، متلب MATLAB و Python تسلط و سابقه تدریس فعال دارند.
| نام اثر: | استخراج ویژگی از متن با روش اطلاعات متقابل Mutual Information |
| نوع اثر: | دوره آموزشی |
| مدرس: | امین جلیل زاده رزین |
| مدت زمان: | 35 دقیقه |
توجه: کیفیت این محصول توسط پی استور تضمین شده و در صورت عدم رضایت از محصول، به انتخاب شما:
هزینه سفارش:
۴۰۰,۰۰۰ تومان قیمت اصلی: ۴۰۰,۰۰۰ تومان بود.۲۱۰,۰۰۰ تومانقیمت فعلی: ۲۱۰,۰۰۰ تومان.
دیدگاهها و نظرات
هستی عبدالله زاده
توضیحات کامل و ب زبان ساده بود
ممنون
افشین رزمجو
خلاصه و مفید و کاربردی هست.
عارف
انتخاب ویژگی به روش iG رو هم لطفا بزارید
مدیریت و پشتیبانی
نظرات و پیشنهادات خود را با ما در میان بگذارید.