添加链接
link之家
链接快照平台
  • 输入网页链接,自动生成快照
  • 标签化管理网页链接

1、jieba项目地址:https://github.com/fxsjy/jieba

2、jiagu项目地址:https://github.com/ownthink/Jiagu

使用心得:

1、利用jieba进行关键词提取,提取之前可以通过

    1、词性标注进行过滤,主要使用参数allowPOS ,
    2、加载停用词表进行词汇的过滤

2、关键词提取函数

jieba.analyse.extract_tags()基于tf-idf

jieba.analyse.textrank()基于textrank

函数参数有一下几个:

sentence 为待提取的文本

topK 为返回的关键词数量,默认值为20

withWeight 为是否一并返回关键词权重值,默认值为False

allowPOS 仅包括指定词性的词,默认值为空,即不筛选

3、关键词提取算法详细原理,以及jieba源代码实习该算法的原理,推荐看这篇文章https://blog.csdn.net/suibianshen2012/article/details/68927060

4、利用jiagu进行关键词提取:jiagu使用的是深度学习,需要训练模型,所以好像很慢,就不推荐了。自己可以参考官方文档,跑跑,测试下。

5、jieba采用的词性表,可以找这个链接:https://blog.csdn.net/csdn_yxy/article/details/84974726,具体参数如图所示:
在这里插入图片描述

text = "183014-山西省脑瘫康复医院_2019年_2019年度行政事业单位国有资产报表" t = time.time() words = jiagu.seg(text) t1 = time.time() print(words) print(t1-t) t2 = time.time() word = jieba.lcut(text, cut_all=False) t3 = time.tim (2)jieba.cut—将文本切分成词语,分词 jieba.cut返回的是一个可迭代的生成器generator,所以能够和for循环一起使用 sentence = '维生素含叶酸' for word in jieba.cut(sentence): print(word) Building prefix dic
Jiagu自然语言处理工具 将提供中文分词,词性标注,命名实体识别,情感分析,知识图谱关系转移,关键字检索,文本摘要,新词发现,情感分析,文本聚类等常用自然语言处理功能。参考了各大工具优缺点制作,将Jiagu回馈给大家。 提供的功能有: 中文分词 命名实体识别 知识图谱关系抽取 关键词提取 等等。。。。 pip install -U jiagu 如果比较慢,可以使用清华的pip源: pip install -U jiagu -i https://pypi.tuna.tsinghua.edu.cn/simple git clone https://github.com/ownthink/Jiagu cd Jiagu python3 setup.py install 快速上手:分词,词性标注,命名实体识别 import jiagu #jiagu.init() # 可手动初始化,也可以动态初始化 text = '厦门明天会不会下雨' words = jiagu . seg ( text ) # 分词
text = ''' 该研究主持者之一、波士顿大学地球与环境科学系博士陈池(音)表示,“尽管中国和印度国土面积仅占全球陆地的9%,但两国为这一绿化过程贡献超过三分之一。考虑到人口过多的国家一般存在对土地过度利用的问题,这个发现令人吃惊。” NASA埃姆斯研究中心的科学家拉玛·内曼尼(Rama Nemani)说,“这一长期数据能让我们深入分析地表绿化背后的影响因素。我们一开始以为,植被增加是由于更多二氧化碳排放,导致气候更加温暖、潮湿,适宜生
Jiagu使用大规模语料训练而成。将提供中文分词、词性标注、命名实体识别、情感分析、知识图谱关系抽取、关键词抽取、文本摘要、新词发现、情感分析、文本聚类等常用自然语言处理功能。 提供的功能有: 中文分词 命名实体识别 知识图谱关系抽取 关键词提取 等等。。。。 pip安装 pip install -U jiagu 如果比较慢,可以使用清华的pip源:pip install -U jiagu
一,什么是jieba(结巴)库? 字如其名,结巴库主要用于中文分词,很形象的画面想必一下子就出现在了大家的面前,结巴在说话时一个词一个词从嘴里往外蹦的时候,已经成功地模拟了我们jieba函数的处理过程!!! 1:Jieba库是优秀的中文分词第三方库,中文文本需要通过分词获得单个的词语。 2:Jieba库的分词原理:利用一个中文词库,确定汉字之间的关联概率,汉字间概率大的组成词组,形成分词
一、jieba简介 jieba库是一款优秀的 Python 第三方中文分词库,jieba 支持三种分词模式:精确模式、全模式和搜索引擎模式,下面是三种模式的特点。 精确模式: 试图将语句最精确的切分,不存在冗余数据,适合做文本分析。 将语句中所有可能是词的词语都切分出来,速度很快,但是存在冗余数据。 搜索引擎模式: 在精确模式的基础上,对长词再次进行切分,提高召回率,适合用于搜索引擎分词。 #精确模式 jieba.lcut(text, cut_all=False) jieba.lcut
安装:https://blog.csdn.net/qq_27717921/article/details/90140012 遇到的坑:1、不能root运行;2、当es data 所在的磁盘存储空间使用超过80%,es自动转为只读模式。 解决办法:1、把es涉及到的路径最好设置成 chmod -R 777 /es相关文件;2、这种情况最好在es安装之初...