C语言实现英文文本词频统计_C类语言-免费资源网

时间：2020-05-26

阅读：

这几天写了一个基于C语言对文本词频进行统计的程序，开发及调试环境：mac集成开发环境Xcode；测试文本，马丁.路德金的《I have a dream》原文演讲稿。

主要运行步骤：

1. 打开文本把文本内容读入流中并且开辟相应空间放入内存
2 .对文本内容进行处理，去除大写字母（转化为小写），去除特殊字符
3. 基于单链表对词频进行统计
4. 把统计结果进行归并排序
5.打印输出全部词频或者频率最高的10个单词和其出现次数
6.释放所有结点消耗的内存

废话不多说，上代码！

//
// main.c
// word_frequency_statistic
//
// Created by tianling on 14-3-16.
// Copyright (c) 2014年 tianling. All rights reserved.
// 实现英文文本的词频统计
//

#include <stdio.h>
#include <stdlib.h>
#include <string.h>

#define ERROR 1
#define OK 0
const int WORD_LENGTH = 250;//定义单个单词最大长度
typedef int status;


/*
 **定义存储单词及其出现次数的结构体
 */
typedef struct Node{
 char word[WORD_LENGTH];
 int time;
 struct Node *next;
}wordNode;

wordNode *headNode = NULL;//定义链表头指针

/*
 **函数声明
 */
wordNode *wordSearch(char *word,int *num);
status wordCount(char *word,int *num);
void printCountList(int *num);
void PrintFirstTenTimes();
void mergeSort(wordNode **head);
void FrontBackSplit(wordNode *head,wordNode **pre,wordNode **next);
void wordJob(char word[]);
wordNode *SortedMerge(wordNode *pre,wordNode *next);
void release();

status main(int argc,char *argv[])
{
 char temp[WORD_LENGTH];//定义用以临时存放单词的数组
 FILE *file;
 int count,articleWordNum = 0;//定义统计结点个数的变量
 int *num = &articleWordNum,choose;
 
 /*
  **读取文件
  */
 if((file = fopen("/Users/tianling/Documents/Data_Structure/word_frequency_statistic/word_frequency_statistic/article.txt", "r")) == NULL){
  //这里是绝对路径，基于XCode编译器查找方便的需求
  printf("文件读取失败!");
  exit(1);
 }
 
 while((fscanf(file,"%s",temp))!= EOF){
  wordJob(temp);
  count = wordCount(temp,num);
 }
 
 fclose(file);//关闭文件
 
 printCountList(num);
 
 printf("***********请选择***********n");
 printf("*****1. 输出词频最高的10个词**n");
 printf("*****2. 退出****************n");
 
 scanf("%d",&choose);
 if(choose == 1){
  mergeSort(&headNode);
  PrintFirstTenTimes();

 }else{
  release();
  exit(0);
 }
 
 release();
 return 0;
 
 
}

/*
 **查找单词所在结点
 */
wordNode *wordSearch(char *word,int *num){
 wordNode *node;//声明一个新结点
 
 if(headNode == NULL){//若头结点为空
  node = (wordNode*)malloc(sizeof(wordNode));
  strcpy(node->word, word);//将第一个单词赋值给这个新结点
  node->time = 0;//初始化该单词的出现次数
  *num+=1;
  headNode = node;//将头结点指向这个新结点
  return node;
  
 }
 
 wordNode *nextNode = headNode;
 wordNode *preNode = NULL;
 
 while(nextNode != NULL && strcmp(nextNode->word, word) != 0){
  preNode = nextNode;
  nextNode = nextNode->next;
 }
 
 //若该单词不存在，则在链表中生成新结点
 if(nextNode == NULL){
  node = (wordNode*)malloc(sizeof(wordNode));
  strcpy(node->word, word);
  node->time = 0;
  node->next = headNode->next;
  headNode->next = node;
  *num+=1;
  
  return node;
 }else
  return nextNode;
 
}


/*
 **词频统计
 */
status wordCount(char *word,int *num){
 wordNode *tmpNode = NULL;
 tmpNode = wordSearch(word,num);
 
 if(tmpNode == NULL){
  return ERROR;
 }
 
 tmpNode->time++;
 
 return 0;
}


/*
 **打印所有词频
 */
void printCountList(int *num){
 if(headNode == NULL){
  printf("该文件无内容！");
  
 }else{
  wordNode *preNode = headNode;
  printf("总词量 %d n",*num);
  
  while(preNode != NULL){
   printf("%s 出现次数 %dn",preNode->word,preNode->time);
   preNode = preNode->next;
  }
 }
 
}


/*
 **打印词频最高的10个词
 */
void PrintFirstTenTimes(){
 if(headNode == NULL){
  printf("该文件无内容!");
  
 }else{
  wordNode *preNode = headNode;
  int i = 0;
  printf("出现次数最多的10个词如下: n");
  
  while (preNode != NULL && i<=10) {
   printf("%s 出现次数 %dn",preNode->word,preNode->time);
   preNode = preNode->next;
   i++;

  }
 }
}


/*
 **对词频统计结果进行归并排序
 */
void mergeSort(wordNode **headnode){
 wordNode *pre,*next,*head;
 head = *headnode;
 
 //若链表长度为0或1则停止排序
 if(head == NULL || head->next == NULL){
  return;
 }
 
 FrontBackSplit(head,&pre,&next);
 
 mergeSort(&pre);
 mergeSort(&next);
 
 *headnode = SortedMerge(pre,next);
 
}


/*
 **将链表进行分组
 */
void FrontBackSplit(wordNode *source,wordNode **pre,wordNode **next){
 wordNode *fast;
 wordNode *slow;
 
 if(source == NULL || source->next == NULL){
  *pre = source;
  *next = NULL;
 }else{
  slow = source;
  fast = source->next;
  
  while(fast != NULL){
   fast = fast->next;
   
   if(fast != NULL){
    slow = slow->next;
    fast = fast->next;
   }
  }
  *pre = source;
  *next = slow->next;
  slow->next = NULL;
 }
}


/*
 **根据排序结果更换头结点
 */
wordNode *SortedMerge(wordNode *pre,wordNode *next){
 wordNode *result = NULL;
 
 if(pre == NULL)
  return next;
 else if(next == NULL)
  return pre;
 
 if(pre->time >= next->time){
  result = pre;
  result->next = SortedMerge(pre->next,next);
  
 }else{
  result = next;
  result->next = SortedMerge(pre,next->next);
 }
 return result;
}


/*
 **处理大写字母及特殊字符
 */
void wordJob(char word[]){
 int i,k;
 char *specialChar = ",.;:'?!><+=|*&^%$#@"";//定义特殊字符集
 
 for(i = 0;i<strlen(word);i++){
  //筛选并将字符串中的大写字母转化为小写字母
  if(word[i]>='A'&& word[i]<='Z'){
   word[i] += 32;
  }
  //筛选并去除字符串中的特殊字符
  for(k = 0;k<strlen(specialChar);k++){
   
   if(word[i] == specialChar[k]){
    
    while(i<strlen(word)){
     word[i] = word[i+1];
     i++;
    }
    
   }
  }
 }
 
}


/*
 **释放所有结点内存
 */
void release(){
 if(headNode == NULL)
  return;
 
 wordNode *pre = headNode;
 while(pre != NULL){
  headNode = pre->next;
  free(pre);
  pre = headNode;
  
 }
}

调试结果：（Xcode环境）

以上就是本文的全部内容，希望对大家的学习有所帮助，也希望大家多多支持。

目录 0、常见的判断图片文件的方法 1. 根据文件扩展名判断代码示例优缺点 2. 通过文件头（Magic Number）判断代码示例优缺点 3. 使用 ImageSharp 判断文件是否为图

2024-10-18 23:26:39

目录 1.界面实现效果 2.简介 3.使用1.界面实现效果以下是具体的项目需要用到的效果展示，用于验证字母。2.简介自定义CaptchaMovableLabel，继承自QLabel类：
中间的4个字母，就是Ca

2024-10-18 23:26:30

目录一、函数输入二、函数输出三、使用示例一、函数输入输入有两个，参数一：需要截图的容器控件，参数二：保存截图的绝对路径路径<param name="control">控件名</param>
<param

2024-10-14 19:57:08

目录1. 使用 Lambda 表达式和标准库 std::function2. 使用 std::future 和 std::promise3. 使用协程 (C++20)4. 使用异步框架总结“地狱回调”（Callback Hell）是指

2024-09-10 22:05:57

目录简介什么是Buffer OverflowBuffer Overflow的常见原因如何检测和调试Buffer Overflow解决Buffer Overflow的最佳实践详细实例解析示例1：数组越界写入示例2：未检查输入长度

2024-09-10 22:05:55

目录引言段错误的产生原因段错误的检测方法段错误的预防措施段错误的解决方案总结引言段错误（Segmentation Fault）是 C++ 编程中常见且令人头疼的错误之一。段错误通常发生在

2024-09-10 22:05:53

QPushButton是Qt库中的一个重要组件，它是用户界面（UI）设计中常用的一个按钮控件。在Qt程序中，QPushButton用于创建可以在界面上点击响应操作的交互元素。它的主要作用包括：显示文

2024-09-10 22:05:51

目录引言示例需求开发环境代码实现运行结果程序分析注意引言之前写了一个手动切换多个布局的程序，下面来记录一下。
程序运行效果如下：示例需求通过点击程序界面上不同的布局

2024-09-10 22:05:49

目录前言1. 加载数据库驱动2. 创建数据库连接3. 执行SQL查询或命令4. 关闭数据库连接示例完整代码片段打开多个数据库使用建议总结前言在Qt中访问数据库涉及到几个关键步骤

2024-09-10 22:05:47

目录步骤 1: 安装Protobuf步骤 2: 配置Qt项目步骤 3: 编译和运行项目运行qmake以生成Makefile：注意事项在Qt项目中使用Protobuf（Protocol Buffers）可以有效地处理数据序列化和

2024-09-10 22:05:45

目录一：功能二：用法一：功能 iota 是给定一个初始元素，然后依次对序列中每个元素进行递增++操作，详见代码一； atoi 是将字符串转换成整数；atol, atoll 将字符串转换成

2024-09-10 22:05:43

目录前言1. 直接在字符串中包含空格2. 使用 %s 和空格3. 使用 \t 输出制表符（Tab）4. 使用循环输出多个空格5. 使用格式控制符输出空格总结前言在C语言中，输出空格可以通过使用

2024-09-10 22:05:41

一、为什么使用文件在学习完结构体后，为了检验学习成果，我们写了一个通讯录的小程序，当通讯录运行起来的时候，可以给通讯录中增加、删除数据，此时数据是存放在内存中的，当程序退出

2024-09-10 22:05:39

目录1. 使用 QThread::sleep示例代码：说明：优点：缺点：2. 使用 QTimer 和事件循环示例代码：说明：优点：缺点：3. 使用 QEventLoop 结合 QTimer示例代码：说明：优点：缺点：4. 使用 QPauseAnima

2024-09-10 22:05:35

目录C 语言中如何实现自定义数据类型的输入输出一、结构体数据类型的输入输出二、枚举数据类型的输入输出三、联合数据类型的输入输出四、使用指针实现复杂数据结构的输入输

2024-09-10 22:05:34

目录一、背景二、环境依赖安装三、编写kakfa生产者消费者3.1 生产者3.2 消费者3.3 编译运行3.3.1 编译生产者消费者3.3.2 运行验证3.4 SASL认证kakfa3.5 结束语一、背景在实

2024-09-10 22:05:32

目录传值传址传引用如何选择合适的参数传递方式在C++中，参数传递方式主要有三种：传值（pass by value）、传址（pass by address）、传引用（pass by reference）。每种方式都有其特定的使

2024-09-10 22:05:30

目录概述CHP_Sha256总结概述SHA-256，英文全称为Secure Hash Algorithm 256-bit，是一种广泛使用的密码散列函数，属于SHA-2家族。SHA-256算法由美国国家安全局（NSA）设计，并由美国国

2024-09-10 22:05:28

简介assert 是 C 语言中的一个宏，用于在程序运行时进行条件检查，主要用于调试目的。它在 <assert.h> 头文件中定义，用于验证程序中的假设条件是否成立，如果不成立，程序将打印错误

2024-09-10 22:05:26

目录1.引言2.简单示例3.推荐使用方法4.常见使用场景和注意事项4.1.检查参数的合法性4.2.assert不能使用改变环境的语句4.3.在未知的逻辑中添加assert(false)5.总结1.引言ass

2024-09-10 22:05:24

目录一、基本概念二、用法1.旧版用法（Qt4和早期Qt5）2.新版用法（推荐）3.自动连接（无需使用connect()函数）4.Lambda表达式（Qt5.4）三、断开连接disconnect()1.为什么使用disconnect()2.

2024-09-10 22:05:23

目录一、inline关键字1.1 什么是内联函数？1.2 为什么会有内联函数？1.2.1 回顾宏1.2.2 宏的改进–内联函数1.3 内联函数的特性二、指针空值nullptr2.1 C和C++中NULL的含义

2024-09-10 22:05:21

目录1.获取服务器IP2.安装并且启用ssh服务3.在vscode中远程连接 4.实现免密登录vscode的远程连接功能十分方便，可以让我们在一个开发工具中实现完整的工作流，下面介绍如何在vs

2024-09-10 22:05:18

目录LRU的概念哈希表（unordered_map）主要特性常用操作双向链表（list）特性常用操作LRU缓存（C++）初始化状态LRU的概念LRU（Least Recently Used，最近最少使用）是一种常用的缓存淘汰策略，

2024-09-10 22:05:16

目录一、前言二、代码实操2.1 将二进制数据转为Base64编码2.2 实现图片的base64编码和解码一、前言Base64编码是一种广泛使用的编码方案，将任意二进制数据转换为可打印的ASCI

2024-09-10 22:05:14

目录一、strcat函数的简介二、strcat函数的使用三、strcat函数的注意事项四、strcat函数的模拟实现一、strcat函数的简介strcat函数用于将源字符串追加到目标字符串的末尾，并

2024-09-10 22:05:12

目录1.C++ 的存储类型1.1.存储周期（Storage duration）1.2.存储类型说明符（Storage class specifiers）1.3.存储类型说明符与存储周期的关系2.thread_local简介3.thread_local 应

2024-09-10 22:05:10

c++栈内存和堆内存的基本使用#include <iostream>// 定义一个简单的结构体struct Person { std::string name; int age;};int main() { // 栈内存分配 int a = 10; //

2024-09-10 22:05:08

目录<mutex>std::call_once函数例程:使用call_once实现的单例模式std::mutex类 -- 独占互斥锁成员函数std::recursive_mutex类 -- 递归互斥锁使用注意:描述:std::timed_mute

2024-09-10 22:05:06

目录C++实现字符串元音字母反转的巧妙方法示例方法一：利用数据结构存储元音位置和字符并反转代码实现1. 如何在C++中存储数字和字符并支持翻转2. 判断字符是否在列表中3. 巧

2024-09-10 22:05:04

2020-05-31

2021-06-03

2020-05-26

2021-04-24

2020-11-01

2020-05-26

2021-02-22

2020-06-19

2020-11-01

C语言实现英文文本词频统计

使用C#判断文件是否为图片的多种方法

QT 实现随机验证码功能

C# Winform截图指定控件范围内的图像的流程步骤

C++解决回调地狱问题的方法小结

C语言报错：Buffer Overflow的原因和解决办法

C++报错：Segmentation Fault的解决方案

Qt中QPushButton组件的使用详解

Qt实现手动切换多种布局的完美方案

一篇文章详解Qt中如何访问数据库

Qt 编译配置 Protobuf 的详细步骤

C++ STL iota 和 atoi 用法示例详解

C语言中输出空格的五种方法

C语言文件操作入门指南

Qt中暂停程序的几种方法小结

C语言中实现自定义数据类型的输入输出的方法和技巧

详解C/C++如何发送与接收Kafka消息

C++传值、传址、传引用的区别和选择小结

C++如何实现sha256算法

C语言中的断言函数assert详解

C++之assert推荐用法及注意事项

Qt中connect()函数及用法详解

深入解读C++ 内联函数inline|nullptr

vscode远程连接服务器(免密登录+远程开发)

C++实现LRU缓存的操作方法

使用C语言生成图片的base64编码的代码实现

C语言strcat函数详解：字符串追加的利器

C++之thread_local变量的一些用法

c++栈内存和堆内存的基本使用小结

C++11标准库互斥锁 <mutex> 详解

C++实现字符串元音字母反转的两种方法

热点内容

免费资源网

在线工具

扫一扫随时看

本站下载频道