<?xml version='1.0' encoding='UTF-8'?>
<ArticleSet>
  <Article>
    <Journal>
      <PublisherName>Apadana</PublisherName>
      <PublisherNameVernacular>موسسه آموزش عالی آپادانا</PublisherNameVernacular>
      <JournalTitle>New Researches in the Smart City</JournalTitle>
      <JournalTitleVernacular>فصلنامه پژوهش های نوین در شهرهوشمند</JournalTitleVernacular>
      <Issn>2980-8936</Issn>
      <Volume></Volume>
      <Issue></Issue>
      <PubDate PubStatus="epublish">
        <Year></Year>
        <Month></Month>
        <Day></Day>
      </PubDate>
    </Journal>

    <ArticleTitle>A Machine Learning Hybrid Model for News Text Classification Using TF-IDF Features and Language Models</ArticleTitle>
    <VernacularTitle>مدل ترکیبی یادگیری ماشین برای طبقه‌بندی متون خبری با استفاده از ویژگی‌های وزنی زبان و مدل‌های زبانی</VernacularTitle>

    <FirstPage></FirstPage>
    <LastPage></LastPage>
    <ELocationID EIdType="doi"></ELocationID>
    <Language>FA</Language>

    <AuthorList>
      <Author>
        <FirstName>Haleh</FirstName>
        <LastName>Homayouni</LastName>
        <Affiliation>Assistant Professor, Department of Computer Engineering, Faculty of Engineering, Apadana Institute of Higher Education, Shiraz, Iran</Affiliation>
        <VernacularFirstName>هاله</VernacularFirstName>
        <VernacularLastName>همایونی</VernacularLastName>
        <VernacularAffiliation>استادیار،گروهکامپیوتر،دانشکده فنیو مهندسی،مؤسسه آموزش عالیآپادانا، شیراز،ایران</VernacularAffiliation>
      </Author>
      <Author>
        <FirstName>Kimia</FirstName>
        <LastName>Bazargan Lari</LastName>
        <Affiliation>Assistant Professor, Department of Computer Engineering, Faculty of Engineering, Apadana Institute of Higher Education, Shiraz, Iran</Affiliation>
        <VernacularFirstName>کیمیا</VernacularFirstName>
        <VernacularLastName>بازرگان لاری</VernacularLastName>
        <VernacularAffiliation>استادیار،گروهکامپیوتر،دانشکده فنیو مهندسی،مؤسسه آموزش عالیآپادانا، شیراز،ایران</VernacularAffiliation>
      </Author>
    </AuthorList>

    <PublicationType></PublicationType>

    <History>
      <PubDate PubStatus="received">
        <Year></Year>
        <Month></Month>
        <Day></Day>
      </PubDate>
    </History>

    <Abstract>The rapid growth of online news has increased the need for intelligent and automated systems to organize information and provide content recommendations tailored to users’ interests. Although traditional approaches such as word weighting and the Naive Bayes algorithm have laid the foundation for this field, their inability to capture deep semantic meanings and process large volumes of data quickly has limited their practical use. In this study, a hybrid framework for news classification is proposed that integrates classical machine learning with modern computational linguistics technologies. The proposed method introduces three key innovations: first, domain-specific feature extraction to identify discriminative terms; second, the use of advanced language models to more accurately detect important words and disambiguate rare terms; and third, the design of an optimized mechanism that maintains high accuracy while significantly improving system speed. The model was tested on a dataset of Sina News articles across 11 categories and achieved an accuracy of 95%, representing a significant improvement over conventional method. The results show that the system performs exceptionally well in distinguishing semantically distinct news categories while maintaining high speed and computational efficiency for real-world applications. This research bridges the gap between traditional statistical methods and modern intelligent models, offering an effective and low-cost solution for news classification systems.</Abstract>
    <OtherAbstract Language="FA">رشد روزافزون اخبار آنلاین، نیاز به سامانه‌های خودکار و هوشمند را برای سازمان‌دهی اطلاعات و پیشنهاد مطالب متناسب با علایق کاربران افزایش داده است. با وجود آنکه روش‌های سنتی مانند استفاده از وزن‌دهی واژه‌ها و الگوریتم بیز ساده، پایه‌گذار این حوزه بوده‌اند، ناتوانی آن‌ها در درک معنای عمیق واژه‌ها و پردازش سریع داده‌ها، کاربرد عملی‌شان را محدود کرده است. در این پژوهش، چارچوبی ترکیبی برای طبقه‌بندی اخبار پیشنهاد شده که یادگیری ماشین کلاسیک را با فناوری‌های نوین زبان‌شناسی رایانه‌ای تلفیق می‌کند. در این روش سه نوآوری اصلی ارائه شده است: نخست، استخراج ویژگی‌های اختصاصی هر حوزه برای شناسایی واژه‌های متمایز؛ دوم، استفاده از مدل‌های زبانی پیشرفته برای تشخیص دقیق‌تر واژه‌های مهم و رفع ابهام در واژه‌های کم‌کاربرد؛ و سوم، طراحی سازوکاری بهینه که با حفظ دقت بالا، سرعت اجرای سامانه را چندین برابر افزایش می‌دهد. این مدل بر مجموعه‌ای از اخبار وب‌سایت سینا در ۱۱ دسته آزمایش شد و دقتی برابر با ۹۵ درصد به دست آورد که نسبت به روش‌های مرسوم بهبود چشمگیری داشت. نتایج نشان می‌دهد سامانه در تفکیک دسته‌های خبری با تفاوت معنایی واضح عملکرد بسیار خوبی دارد و در عین حال از نظر سرعت و بهره‌وری برای استفاده واقعی نیز مناسب است. این پژوهش گامی در جهت پیوند میان روش‌های آماری سنتی و مدل‌های هوشمند نوین است و می‌تواند الگویی کارآمد و کم‌هزینه برای سامانه‌های خبری فراهم کند.</OtherAbstract>

    <ObjectList>
      <Object Type="keyword"><Param Name="value">Feature Extraction</Param></Object>
      <Object Type="keyword"><Param Name="value">Naive Bayes</Param></Object>
      <Object Type="keyword"><Param Name="value">TF</Param></Object>
      <Object Type="keyword"><Param Name="value">IDF</Param></Object>
      <Object Type="keyword"><Param Name="value">News Classification</Param></Object>
      <Object Type="keyword"><Param Name="value">Natural Language Processing</Param></Object>
      <Object Type="keyword"><Param Name="value">Hybrid Model</Param></Object>
      <Object Type="keyword"><Param Name="value">Machine Learning</Param></Object>
      <Object Type="keyword"><Param Name="value_vernacular">استخراج ویژگی</Param></Object>
      <Object Type="keyword"><Param Name="value_vernacular">بیز ساده</Param></Object>
      <Object Type="keyword"><Param Name="value_vernacular">TF</Param></Object>
      <Object Type="keyword"><Param Name="value_vernacular">IDF</Param></Object>
      <Object Type="keyword"><Param Name="value_vernacular">طبقه‌بندی اخبار</Param></Object>
      <Object Type="keyword"><Param Name="value_vernacular">پردازش زبان طبیعی</Param></Object>
      <Object Type="keyword"><Param Name="value_vernacular">مدل ترکیبی</Param></Object>
      <Object Type="keyword"><Param Name="value_vernacular">یادگیری ماشین</Param></Object>
    </ObjectList>

    <ArchiveCopySource DocType="pdf">https://nrsc.apadana.ac.ir/downloadfilepdf/914103</ArchiveCopySource>
  </Article>
</ArticleSet>