CIVILICA We Respect the Science
(ناشر تخصصی کنفرانسهای کشور / شماره مجوز انتشارات از وزارت فرهنگ و ارشاد اسلامی: ۸۹۷۱)
عنوان
مقاله

گام نخست در کاوش متون فارسی

اعتبار موردنیاز: ۱ | تعداد صفحات: ۷ | تعداد نمایش خلاصه: ۳۰۴۳ | نظرات: ۰
سال انتشار: ۱۳۸۶
کد COI مقاله: IDMC01_021
زبان مقاله: فارسی
فایل PDF حاوی متن کامل این مقاله در حال حاضر در سایت موجود نمی‌باشد.

راهنمای دانلود فایل کامل این مقاله

متن کامل این مقاله منتشر نشده و درپایگاه سیویلیکا موجود نمی باشد.

منبع مقالات سیویلیکا دبیرخانه کنفرانسها است. برخی از دبیرخانه ها اقدام به انتشار اصل مقاله نمی نمایند. به منظور تکمیل بانک مقالات موجود، چکیده این مقالات در سایت درج می شوند ولی به دلیل عدم انتشار اصل مقاله، امکان ارائه آن وجود ندارد.

خرید و دانلود PDF مقاله

اصل مقاله (فول تکست) فوق منتشر نشده و یا در سایت موجود نیست و امکان خرید آن فراهم نمی باشد

مشخصات نویسندگان مقاله گام نخست در کاوش متون فارسی

  آذر شاهقلیان - دانشگاه آزاد اسلامی واحد نجف آباد،
  محمدحسین سرایی - عضو هیأت علمی دانشگاه صنعتی اصفهان، استاد مدعو دانشگاه آزاد اسلامی و
  علی شالبافزاده - دانشگاه صنعتی اصفهان

چکیده مقاله:

طبقه بندی بر مبنای فاصله برای طبقه بندی متون فارسی پیشنهاد داده شده است . طبقه بند، در فاز یادگیری، مجموعه - ای از متون آموزشی را برای استخراج ویژگیهای دستهها بررسی میکند تا خصوصیات اصلی ویژه دسته را بدست آورد . بطوریکه در فاز تست طبقهبند، این ویژگیهای مختص دسته برای طبقه بندی متون طبقهبندی نشده بهکار میرود . از stemming برای کاهش دیمانسیون بردارهای ویژگی استفاده میشود . دقت طبقهبند بوسیله اعمال الگوریتم روی مجموعه جمعآوری شدهای از متون فارسی، مورد آزمایش قرار گرفته است . نتایج حاصله نشان میدهد که طبقهبند پیشنهادی از دقت بالایی برخوردار است . مجموعهای از متون فارسی که از روی سایتهای خبری موجود در وب جمع آوری شده است، برای انجام این تحقیق بکار میرود . این متون در ابتدا بوسیله از بین بردن علائم نقطهگذاری و کلمات بیفایده، پیش پردازش میشوند . در طبقهبند برای نمایش هر متن از یک بردار ویژگی استفاده میشود که شامل کلمات شاخص و میزان تکرار آن کلمات در متن میباشد . پیشگویی طبقهبند بر پایه فرضیات آماری استوار است که متونی که در دسته یکسانی قرار میگیرند، ویژگیهای مشابهی دارند . برای طبقهبندی متن جدید، ابتدا بردار ویژگی آن متن ساخته شده، سپس با بردارهای ویژگی دستهها مقایسه میشود . دسته برنده، دستهای است که به متن جدید نزدیکتر است . این ایده طبقهبندی k-NN میباشد

کلیدواژه‌ها:

طبقهبندی متن، یادگیری ماشین، زبان فارسی، K-NN Classifier

کد مقاله/لینک ثابت به این مقاله

برای لینک دهی به این مقاله، می توانید از لینک زیر استفاده نمایید. این لینک همیشه ثابت است و به عنوان سند ثبت مقاله در مرجع سیویلیکا مورد استفاده قرار میگیرد:
https://www.civilica.com/Paper-IDMC01-IDMC01_021.html
کد COI مقاله: IDMC01_021

نحوه استناد به مقاله:

در صورتی که می خواهید در اثر پژوهشی خود به این مقاله ارجاع دهید، به سادگی می توانید از عبارت زیر در بخش منابع و مراجع استفاده نمایید:
شاهقلیان, آذر؛ محمدحسین سرایی و علی شالبافزاده، ۱۳۸۶، گام نخست در کاوش متون فارسی، اولین کنفرانس داده کاوی ایران، تهران، دانشگاه صنعتی امیرکبیر، موسسه پژوهشی داده پردازان گیتا، https://www.civilica.com/Paper-IDMC01-IDMC01_021.html

در داخل متن نیز هر جا که به عبارت و یا دستاوردی از این مقاله اشاره شود پس از ذکر مطلب، در داخل پارانتز، مشخصات زیر نوشته می شود.
برای بار اول: (شاهقلیان, آذر؛ محمدحسین سرایی و علی شالبافزاده، ۱۳۸۶)
برای بار دوم به بعد: (شاهقلیان؛ سرایی و شالبافزاده، ۱۳۸۶)
برای آشنایی کامل با نحوه مرجع نویسی لطفا بخش راهنمای سیویلیکا (مرجع دهی) را ملاحظه نمایید.

علم سنجی و رتبه بندی مقاله

مشخصات مرکز تولید کننده این مقاله به صورت زیر است:
نوع مرکز:
تعداد مقالات: ۹۲۸۶
در بخش علم سنجی پایگاه سیویلیکا می توانید رتبه بندی علمی مراکز دانشگاهی و پژوهشی کشور را بر اساس آمار مقالات نمایه شده مشاهده نمایید.

مدیریت اطلاعات پژوهشی

اطلاعات استنادی این مقاله را به نرم افزارهای مدیریت اطلاعات علمی و استنادی ارسال نمایید و در تحقیقات خود از آن استفاده نمایید.

مقالات مرتبط جدید

شبکه تبلیغات علمی کشور

به اشتراک گذاری این صفحه

اطلاعات بیشتر درباره COI

COI مخفف عبارت CIVILICA Object Identifier به معنی شناسه سیویلیکا برای اسناد است. COI کدی است که مطابق محل انتشار، به مقالات کنفرانسها و ژورنالهای داخل کشور به هنگام نمایه سازی بر روی پایگاه استنادی سیویلیکا اختصاص می یابد.
کد COI به مفهوم کد ملی اسناد نمایه شده در سیویلیکا است و کدی یکتا و ثابت است و به همین دلیل همواره قابلیت استناد و پیگیری دارد.