1、jieba项目地址:https://github.com/fxsjy/jieba
2、jiagu项目地址:https://github.com/ownthink/Jiagu
使用心得:
1、利用jieba进行关键词提取,提取之前可以通过
1、词性标注进行过滤,主要使用参数allowPOS ,
2、加载停用词表进行词汇的过滤
2、关键词提取函数
jieba.analyse.extract_tags()基于tf-idf
jieba.analyse.textrank()基于textrank
函数参数有一下几个:
sentence 为待提取的文本
topK 为返回的关键词数量,默认值为20
withWeight 为是否一并返回关键词权重值,默认值为False
allowPOS 仅包括指定词性的词,默认值为空,即不筛选
3、关键词提取算法详细原理,以及jieba源代码实习该算法的原理,推荐看这篇文章https://blog.csdn.net/suibianshen2012/article/details/68927060
4、利用jiagu进行关键词提取:jiagu使用的是深度学习,需要训练模型,所以好像很慢,就不推荐了。自己可以参考官方文档,跑跑,测试下。
5、jieba采用的词性表,可以找这个链接:https://blog.csdn.net/csdn_yxy/article/details/84974726,具体参数如图所示:

jiagu分词和jieba分词的区别
1、jieba项目地址:https://github.com/fxsjy/jieba2、jiagu项目地址:https://github.com/ownthink/Jiagu使用心得:1、利用jieba进行关键词提取,提取之前可以通过 1、词性标注进行过滤,主要使用参数allowPOS , 2、加载停用词表进行词汇的过滤2、关键词提取函数jieba.analyse.extract_tags()基于tf-idfjieba.analyse.textrank()基于textrank
text = "183014-山西省脑瘫康复医院_2019年_2019年度行政事业单位国有资产报表"
t = time.time()
words = jiagu.seg(text)
t1 = time.time()
print(words)
print(t1-t)
t2 = time.time()
word = jieba.lcut(text, cut_all=False)
t3 = time.tim
(2)jieba.cut—将文本切分成词语,分词
jieba.cut返回的是一个可迭代的生成器generator,所以能够和for循环一起使用
sentence = '维生素含叶酸'
for word in jieba.cut(sentence):
print(word)
Building prefix dic
Jiagu自然语言处理工具
将提供中文分词,词性标注,命名实体识别,情感分析,知识图谱关系转移,关键字检索,文本摘要,新词发现,情感分析,文本聚类等常用自然语言处理功能。参考了各大工具优缺点制作,将Jiagu回馈给大家。
提供的功能有:
中文分词
命名实体识别
知识图谱关系抽取
关键词提取
等等。。。。
pip install -U jiagu
如果比较慢,可以使用清华的pip源: pip install -U jiagu -i https://pypi.tuna.tsinghua.edu.cn/simple
git clone https://github.com/ownthink/Jiagu
cd Jiagu
python3 setup.py install
快速上手:分词,词性标注,命名实体识别
import jiagu
#jiagu.init() # 可手动初始化,也可以动态初始化
text = '厦门明天会不会下雨'
words = jiagu . seg ( text ) # 分词
text = '''
该研究主持者之一、波士顿大学地球与环境科学系博士陈池(音)表示,“尽管中国和印度国土面积仅占全球陆地的9%,但两国为这一绿化过程贡献超过三分之一。考虑到人口过多的国家一般存在对土地过度利用的问题,这个发现令人吃惊。”
NASA埃姆斯研究中心的科学家拉玛·内曼尼(Rama Nemani)说,“这一长期数据能让我们深入分析地表绿化背后的影响因素。我们一开始以为,植被增加是由于更多二氧化碳排放,导致气候更加温暖、潮湿,适宜生
Jiagu使用大规模语料训练而成。将提供中文分词、词性标注、命名实体识别、情感分析、知识图谱关系抽取、关键词抽取、文本摘要、新词发现、情感分析、文本聚类等常用自然语言处理功能。
提供的功能有:
中文分词
命名实体识别
知识图谱关系抽取
关键词提取
等等。。。。
pip安装
pip install -U jiagu
如果比较慢,可以使用清华的pip源:pip install -U jiagu
一,什么是jieba(结巴)库?
字如其名,结巴库主要用于中文分词,很形象的画面想必一下子就出现在了大家的面前,结巴在说话时一个词一个词从嘴里往外蹦的时候,已经成功地模拟了我们jieba函数的处理过程!!!
1:Jieba库是优秀的中文分词第三方库,中文文本需要通过分词获得单个的词语。
2:Jieba库的分词原理:利用一个中文词库,确定汉字之间的关联概率,汉字间概率大的组成词组,形成分词
一、jieba简介
jieba库是一款优秀的 Python 第三方中文分词库,jieba 支持三种分词模式:精确模式、全模式和搜索引擎模式,下面是三种模式的特点。
精确模式:
试图将语句最精确的切分,不存在冗余数据,适合做文本分析。
将语句中所有可能是词的词语都切分出来,速度很快,但是存在冗余数据。
搜索引擎模式:
在精确模式的基础上,对长词再次进行切分,提高召回率,适合用于搜索引擎分词。
#精确模式
jieba.lcut(text, cut_all=False)
jieba.lcut
安装:https://blog.csdn.net/qq_27717921/article/details/90140012
遇到的坑:1、不能root运行;2、当es data 所在的磁盘存储空间使用超过80%,es自动转为只读模式。
解决办法:1、把es涉及到的路径最好设置成 chmod -R 777 /es相关文件;2、这种情况最好在es安装之初...