کشف ویژگی برای تجزیه و تحلیل متن

ساخت وبلاگ

با گذشت سالها ، مردم غالباً این فرضیه را مطرح کرده اند که بازخورد منفی باید برای بهبود عملکرد سیستم های فیلتر اطلاعات بسیار مفید باشد. با این حال ، ما برای پشتیبانی از این فرضیه مدلهای بسیار مؤثر به دست نیاوردیم. در این مقاله ، یک مدل مؤثر ارائه شده است که از بازخورد ارتباط منفی بر اساس یک رویکرد معدن الگوی برای بهبود ویژگی های استخراج شده استفاده می کند. این مطالعه بر دو موضوع اصلی استفاده از بازخورد ارتباط منفی متمرکز شده است: انتخاب نمونه های منفی سازنده برای کاهش فضای نمونه های منفی. و تجدید نظر در ویژگی های موجود بر اساس نمونه های منفی انتخاب شده. اولی برخی از اسناد مجرم را انتخاب می کند ، جایی که اسناد متخلف اسناد منفی هستند که به احتمال زیاد در گروه مثبت طبقه بندی می شوند. گروه های بعدی ویژگی های استخراج شده را به سه گروه تبدیل می کنند: دسته خاص مثبت ، دسته کلی و دسته خاص منفی برای به روزرسانی وزن. یک الگوریتم تکراری نیز برای اجرای این رویکرد در مجموعه داده های RCV1 پیشنهاد شده است ، و آزمایش های قابل توجهی نشان می دهد که رویکرد پیشنهادی به عملکرد دلگرم کننده دست می یابد.

بارگیری رایگان PDF PDF

تضمین کیفیت ویژگی های ارتباط کشف شده در اسناد متنی برای توصیف ترجیحات کاربر به دلیل تعداد زیادی از اصطلاحات ، الگوهای و سر و صدا ، یک چالش بزرگ است. بیشتر روشهای موجود در معدن و طبقه بندی متن محبوب رویکردهای مبتنی بر اصطلاح را اتخاذ کرده اند. با این حال ، همه آنها از مشکلات پلی سمی و مترادف رنج می برند. با گذشت سالها ، مردم غالباً این فرضیه را مطرح کرده اند که روشهای مبتنی بر الگوی باید در توصیف ترجیحات کاربر بهتر از روشهای مبتنی بر اصطلاح عمل کنند ، اما بسیاری از آزمایشات از این فرضیه پشتیبانی نمی کنند. تکنیک نوآورانه ارائه شده در مقاله ، دستیابی به موفقیت برای این مشکل است. این تکنیک هر دو الگوهای مثبت و منفی را در اسناد متنی به عنوان ویژگی های سطح بالاتر کشف می کند تا بتواند بر اساس ویژگی و توزیع آنها در ویژگی های سطح بالاتر ، ویژگی های سطح پایین (اصطلاحات) را به طور دقیق وزن کند. آزمایش های قابل توجه با استفاده از این تکنیک در مورد موضوعات REUTERS CORPUS VOLURE 1 و TREC نشان می دهد که رویکرد پیشنهادی به طور قابل توجهی از روشهای پیشرفته مبتنی بر اصطلاحات تحت تأثیر OKAPI BM25 ، Rocchio یا دستگاه وکتور پشتیبانی و روش های مبتنی بر الگوی بر روی دقت ، بهتر است. اقدامات را به یاد بیاورید و f.

بارگیری رایگان PDF PDF

بازخورد ارتباط (RF) برای بهبود دقت بازیابی بسیار مؤثر است. فن آوری فیلتر اطلاعات سازگار (AIF) از پیشرفت های حاصل از کلیه وظایف درگیر در دهه های گذشته بهره مند شده است. یک مشکل دشوار در AIF نحوه به روزرسانی سیستم با بازخورد جدید به طور کارآمد و مؤثر است. در روشهای بازخورد فعلی ، فرآیندهای به روزرسانی بر به روزرسانی پارامترهای سیستم تمرکز می کنند. در این مقاله ، ما یک رویکرد جدید را توسعه داده ایم ، ویژگی های تطبیقی ویژگی های کشف (ARFD). این به طور خودکار دانش سیستم را بر اساس یک پنجره کشویی بر روی بازخورد مثبت و منفی به روز می کند تا یک مشکل غیر مونهونی را به طور کارآمد حل کند. برخی از اسناد آموزشی جدید با استفاده از دانشی که سیستم در حال حاضر به دست آمده انتخاب می شود. سپس ویژگی های خاص از اسناد آموزشی منتخب استخراج می شود. از روشهای مختلفی برای ادغام و تجدید نظر در وزن ویژگی ها در یک فضای بردار استفاده شده است. مدل جدید برای ویژگی های مرتبط با Discovery (RFD) طراحی شده است ، یک رویکرد مبتنی بر معدن ، که از بازخورد ارتباط منفی برای بهبود کیفیت ویژگی های استخراج شده از بازخورد مثبت استفاده می کند. الگوریتم های یادگیری نیز برای اجرای این رویکرد در مورد موضوعات REUTERS CORPUS Volume 1 و TREC پیشنهاد شده است. آزمایشات نشان می دهد که رویکرد پیشنهادی می تواند به طور کارآمد کار کند و به عملکرد تشویق دست یابد.

بارگیری رایگان PDF PDF

بازخورد ارتباط کاربر معمولاً توسط سیستم های وب برای تفسیر نیازهای اطلاعات کاربر و بازیابی نتایج مؤثر برای کاربران استفاده می شود. با این حال ، نحوه کشف دانش مفید در بازخورد ارتباط کاربر و چگونگی استفاده عاقلانه از دانش کشف شده ، دو مشکل مهم است. با این حال ، درک اینکه چه چیزی یک سند فردی را برای بازخورد خوب یا بد می کند می تواند به حل مشکل قبلی منجر شود. در TREC 2010 ، ما در مسیر بازخورد مربوطه شرکت کردیم و دو مدل را برای استخراج بازخورد شبه مربوطه برای بهبود رتبه اسناد بازیابی شده آزمایش کردیم. مورد اول ، اجرای اصلی ، یک مدل مبتنی بر الگوی بود ، در حالی که مدل دوم ، اجرای اختیاری ، یک مدل مبتنی بر اصطلاح بود. این دو مدل شامل دو مرحله بود: یکی با استفاده از بازخورد مربوطه ارائه شده توسط TREC'10 برای گسترش نمایش داده ها برای استخراج بازخورد شبه مرتبط. یکی با استفاده از بازخورد شبه مرتبط برای یافتن الگوهای و اصطلاحات مفید با توجه به اهمیت و قضاوت بی ربط آنها برای رتبه بندی اسناد. در این مقاله ، توضیحات مفصل آن مدل ها ارائه شده است.

بارگیری رایگان PDF PDF

این یک چالش بزرگ است که به وضوح مرز بین جریان های مثبت و منفی برای سیستم های فیلتر اطلاعات را مشخص کنید. چندین تلاش برای حل این چالش از بازخورد منفی استفاده کرده است. با این حال ، دو موضوع برای استفاده از بازخورد ارتباط منفی برای بهبود اثربخشی فیلتر اطلاعات وجود دارد. مورد اول نحوه انتخاب نمونه های منفی سازنده به منظور کاهش فضای اسناد منفی است. مسئله دوم نحوه تصمیم گیری در مورد ویژگی های استخراج پر سر و صدا است که باید بر اساس نمونه های منفی انتخاب شده به روز شوند. در این مقاله یک رویکرد مبتنی بر معدن الگوی برای انتخاب برخی متخلفان از اسناد منفی پیشنهاد شده است ، جایی که می توان از یک مجرم برای کاهش عوارض جانبی ویژگی های پر سر و صدا استفاده کرد. همچنین ویژگی های استخراج شده (یعنی اصطلاحات) را به سه دسته طبقه بندی می کند: اصطلاحات خاص مثبت ، اصطلاحات کلی و اصطلاحات خاص منفی. به این ترتیب ، می توان از استراتژی های تجدید نظر چندگانه برای به روزرسانی ویژگی های استخراج شده استفاده کرد. یک الگوریتم یادگیری تکراری نیز برای اجرای این رویکرد در جمع آوری داده های RCV1 پیشنهاد شده است ، و آزمایش های قابل توجهی نشان می دهد که رویکرد پیشنهادی به عملکرد دلگرم کننده دست می یابد و عملکرد نیز برای فیلتر سازگار نیز سازگار است.

کسب درآمد از فارکس...
ما را در سایت کسب درآمد از فارکس دنبال می کنید

برچسب : نویسنده : عسلی سهیال بازدید : <-PostHit-> تاريخ : شنبه 26 فروردين 1402 ساعت: 18:10