Lucene简介
Lucene是apache软件基金会4 jakarta项目组的一个子项目,是一个开放源代码的全文检索引擎工具包,但它不是一个完整的全文检索引擎,而是一个全文检索引擎的架构,提供了完整的查询引擎和索引引擎,部分文本分析引擎(英文与德文两种西方语言)。Lucene的目的是为软件开发人员提供一个简单易用的工具包,以方便的在目标系统中实现全文检索的功能,或者是以此为基础建立起完整的全文检索引擎。Lucene是一套用于全文检索和搜寻的开源程式库,由Apache软件基金会支持和提供。Lucene提供了一个简单却强大的应用程式接口,能够做全文索引和搜寻。==在Java开发环境里Lucene是一个成熟的免费开源工具。就其本身而言,Lucene是当前以及最近几年最受欢迎的免费lava信息检索程序库。人们经常提到信息检索程序库,虽然与搜索引擎有关,但不应该将信息检索程序库与搜索引擎相混淆。
Lucene是一个全文检索引擎的架构。那什么是全文搜索引擎?
全文搜索引擎是名副其实的搜索引擎,国外具代表性的有Google、FastU/AlTheWeb、AltaVista、Inktomi、Teoma、WiseNut等,国内著名的有百度(Baidu )。它们都是通过从互联网上提取的各个网站的信息(以网页文字为主)而建立的数据库中,检索与用户查询条件匹配的相关记录,然后按一定的排列顺序将结果返回给用户,因此他们是真正的搜索引擎。
从搜索结果来源的角度,全文搜索引擎又可细分为两种,一种是拥有自己的检索程序( Indexer ),俗称"蜘蛛" ( Spider )程序或"机器人" ( Robot)程序,并自建网页数据库,搜索结果直接从自身的数据库中调用,如上面提到的7家引擎;另一种则是租用其他引擎的数据库,并按自定的格式排列搜索结果,如Lycos引擎。
-
Lucene是一套用于全文检索和搜寻的开源程序库,由Apache软件基金会支持和提供
-
Lucene提供了一个简单却强大的应用程序接口(API),能够做全文索引和搜寻,在Java开发环境里Lucene是一个成熟的免费开放源代码工具
-
Lucene并不是现成的搜索引擎产品,但可以用来制作搜索引擎产品
-
Lucene是一套信息检索工具包! jar包!不包含搜索引擎系统! Lucene包含:索引结构!读写索引的工具!排序,搜索规则...工具类!等
Lucene和ElasticSearch关系: 简单来说,Elasticsearch是基于Lucene做了一些封装和增强
Elasticsearch简介
Elasticsearch是一个实时分布式搜索和分析引擎。它让你以前所未有的速度处理大数据成为可能。 它用于全文搜索、结构化搜索、分析以及将这三者混合使用: 维基百科使用Elasticsearch提供全文搜索并高亮关键字 ,以及输入实时搜索(search-asyou-type)和搜索纠错(did-you-mean)等搜索建议功能。 英国卫报使用Elasticsearch结合用户日志和社交网络数据提供给他们的编辑以实时的反馈,以便及时了解公众对新发表的文章的回应。 StackOverflow结合全文搜索与地理位置查询,以及more-like-this功能来找到相关的问题和答案。 Github使用Elasticsearch检索1300亿行的代码。
并且Elasticsearch不仅用于大型企业,它还让像DataDog以及Klout这样的创业公司将最初的想法变成可扩展的解决方案。
Elasticsearch可以在你的笔记本。上运行,也可以在数以百计的服务器上处理PB级别的数据。 Elasticsearch是一个基于Apache Lucene(TM)的开源搜索引擎。 无论在开源还是专有领域, Lucene可以被认为是迄今为止最先进、性能最好的、功能最全的搜索引擎库。 但是, Lucene只是一个库。想要使用它,你必须使用Java来作为开发语言并将其直接集成到你的应用中,更糟糕的是, Lucene非常复杂,你需要深入了解检索的相关知识来理解它是如何工作的。
Elasticsearch也使用Java开发并使用Lucene作为其核心来实现所有索引和搜索的功能,它的目的是通过简单的RESTful API(REST风格的网络接口,是当下主流的API)来隐藏Lucene的复杂性,从而让全文搜索变得简单。
历史
多年前,一个叫做Shay Banon的刚结婚不久的失业开发者,由于妻子要去伦敦学习厨师,他便跟着也去了。在他找工作的过程中,为了给妻子构建一个食谱的搜索引擎,他开始构建一个早期版本的Lucene。
直接基于Lucene工作会比较困难,所以Shay开始抽象Lucene代码以便]ava程序员可以在应用中添加搜索功能。他发布了他的第一个开源项目,叫做"Compass"。
后来Shay找到一份工作,这份工作处在高性能和内存数据网格的分布式环境中,因此高性能的、实时的、分布式的搜索引擎也是理所当然需要的。然后他决定重写Compass库使其成为一个独立的服务叫做Elasticsearch。
第一个公开版本出现在2010年2月,在那之后Elasticsearch已经成为Github上最受欢迎的项目之一,代码贡献者超过300人。一家主营Elasticsearch的公司就此成立,他们一边提供商业支持一边开发新功能,不过Elasticsearch将永远开源且对所有人可用。
ElasticSearch的应用场景
1、维基百科,类似百度百科,全文检索,高亮,搜索推荐
2、The Guardian (国外新闻网站) , 类似搜狐新闻,用户行为日志(点击,浏览,收藏,评论) +社交网络数据(对某某新闻的相关看法) ,数据分析,给到每篇新闻文章的作者,让他知道他的文章的公众反馈
3、Stack Overflow (国外的程序异常讨论论坛) , IT问题,程序的报错, 提交上去,有人会跟你讨论和回答,全文检索,搜索相关问题和答案,程序报错了,就会将报错信息粘贴到里面去,搜索有没有对应的答案
4、GitHub (开源代码管理)
5、电商网站,检索商品.
6、日志数据分析, logstash采集日志, ES进行复杂的数据分析, ELK技术, elasticsearch(搜索)+logstash(过滤)+kibana(可视化分析)
7、商品价格监控网站,用户设定某商品的价格阈值,当低于该阈值的时候,发送通知消息给用户,比如说订阅牙膏的监控:如果高露洁牙膏的家庭套装低于50块钱,就通知我,我就去买
8、BI系统 ,商业智能, Business Intelligence.比如说有个大型商场集团, BI分析一下某某区域最近3年的用户消费金额的趋势以及用户群体的组成构成,产出相关的数张报表, 最近3年,每年消费金额呈现100%的增长,而且用户群体85%是高级白领。。。
9、国内:站内搜索(电商,招聘,门户,等等),IT系统搜索(OA,CRM,ERP,等等),数据分析(ES热门的一个使用场景)
总而言之,Elasticsearch就是提供高效、个性化检索需求的一种解决方案
ELK简介
ELK是Elasticsearch、Logstash、Kibana三大开源框架首字母大写简称。市面上也被成为Elastic Stack。
其中Elasticsearch是一个基于Lucene、分布式、通过Restful方式进行交互的近实时搜索平台框架。像类似百度、谷歌这种大数据全文搜索引擎的场景都可以使用Elasticsearch作为底层支持框架,可见Elasticsearch提供的搜索能力确实强大,市面上很多时候我们简称Elasticsearch为es.
Logstash是ELK的中央数据流引擎,用于从不同目标(文件/数据存储/MQ )收集的不同格式数据,经过过滤后支持输出以到不同目的地(文件/MQ/redis/elasticsearch/kafka等)。
Kibana可以将es的数据通过友好的页面展示出来 ,提供实时分析的功能。
总结一下就是:收集清洗数据-->建立索引,储存-->Kibana分析
市面上很多开发只要提到ELK能够一致说出它是一 个日志分析架构技术栈总称,但实际上ELK不仅仅适用于日志分析,它还可以支持其它任何数据分析和收集的场景,日志分析和收集只是更具有代表性,并非唯一性。

Docker安装ES和Kibana
1、下载镜像文件
docker pull elasticsearch:7.4.2 存储和检索数据
docker pull kibana:7.4.2 可视化检索数据
2、创建实例
mkdir -p /mydata/elasticsearch/config
mkdir -p /mydata/elasticsearch/data
echo "http.host: 0.0.0.0" >> /mydata/elasticsearch/config/elasticsearch.yml
3,启动es
docker run --name elasticsearch -p 9200:9200 -p 9300:9300 \
-e "discovery.type=single-node" \
-e ES_JAVA_OPTS="-Xms64m -Xmx512m" \
-v /mydata/elasticsearch/config/elasticsearch.yml:/usr/share/elasticsearch/config/elasticsearch.yml \
-v /mydata/elasticsearch/data:/usr/share/elasticsearch/data \
-v /mydata/elasticsearch/plugins:/usr/share/elasticsearch/plugins \
-d elasticsearch:7.4.2
#如果发现es启动不了是端口吗没有暴露就是权限不够设置权限即可
chmod -R 777 /mydata/elasticsearch/ 保证权限
Docker启动Kibana
docker run --name kibana -e ELASTICSEARCH_HOSTS=http://81.69.198.183:9200 -p 5601:5601 \
-d kibana:7.4.2
http://192.168.56.10:9200 #一定改为自己虚拟机的地址
Docker安装IK分词器
#进入到插件目录下
cd /mydata/elasticsearch/plugins/
#下载ik分词器,解压到ik目录下
wget https://github.com/medcl/elasticsearch-analysis-ik/releases/download/v7.4.2/elasticsearch-analysis-ik-7.4.2.zip
#或者在本机进行解压到ik目录添加到plugins下


#设置权限可读,可写,可执行
chmod -R 777 ik
#重启docker
systemctl restart docker

Docker IK自定义词库
安装nginx
#下载镜像
docker pull nginx:1.21
#创建挂载的目录,我是放在/data/nginx里面,可自行更改
mkdir -p /data/nginx/conf #存放配置文件
mkdir -p /data/nginx/logs #存放日志相关
mkdir -p /data/nginx/html #存放html文件
mkdir -p /data/nginx/conf.d #配置nginx访问
#因为不能挂载文件,只能挂载一个文件夹,所以我们要先创建一个测试test容器的nginx,然后复制配置文件到挂载的目录上
##启动测试容器
docker run --name test -d nginx:1.21
##复制配置文件
# test:/etc/nginx/nginx.conf /data/nginx/conf/
# 启动的容器名 nginx的文件位置 linux 自定义目录的位置
docker cp test:/etc/nginx/nginx.conf /data/nginx/conf/
docker cp test:/etc/nginx/conf.d/default.conf /data/nginx/conf.d
##如果不知道配置文件在docker里面的目录位置,可以进去看一下
docker exec -it test /bin/bash
#启动nginx
docker run --name nginx01 --privileged -it -p 80:80 -v /data/nginx/conf/nginx.conf:/etc/nginx/nginx.conf:ro -v /data/nginx/conf.d:/etc/nginx/conf.d:ro -v /data/nginx/html:/usr/share/nginx/html:rw -v/data/nginx/logs:/var/log/nginx -d nginx:1.21
自定义词库
修改nginx配置
cd /data/nginx/html
#创建ik分词要用的一下文件
mkdir es
cd es
#新建一个txt文件存放自己的的分词
vim fenci.txt

#浏览器访问自定义的ik分词
http://81.69.198.183/es/fenci.txt
修改es配置文件
#进入es
docker exec -it b546a2b3619c /bin/bash
#自定义词库nginx的位置容器内部修改
vi /usr/share/elasticsearch/plugins/ik/config/IKAnalyzer.cfg.xml
#容器外进行一个ik分词器的修改,自定义的安装位置
vim /mydata/elasticsearch/plugins/ik/config/IKAnalyzer.cfg.xml

#重启es即可
docker restart elasticsearch
浏览器访问测试

Solr简介
Solr是Apache下的一个顶级开源项目,采用java开发,它是基于Lucene的全文搜索服务器。Solr提供了比Lucene更为丰富的查询语言,同时实现了可配置、可扩展,并对索引、搜索性能进行了优化
Solr可以独立运行在Jetty、Tomcat等这些Servlet容器中 , Solr索引的实现方法很简单,用POST方法向Solr服务器发送一个描述Field及其内容的XML文档,Solr根据xml文档添加、删除、更新索引。
Solr 搜索只需要发送HTTP GET请求,然后对Solr返回xml、json等格式的查询结果进行解析,组织页面布局。Solr不提供构建UI的功能, Solr提供了一个管理界面,通过管理界面可以查询Solr的配置和运行情况。
solr是基于lucene开发企业级搜索服务器,实际上就是封装了lucene.
Solr是一个独立的企业级搜索应用服务器,它对外提供类似于Web-service的API接口。用户可以通过http请求,向搜索引擎服务器提交一定格式的文件,生成索引;也可以通过提出查找请求,并得到返回结果。
ES与Solr对比
单纯地对已有的数据进行搜索,Solr更快

当建立实时索引时,Solr会产生IO阻塞,查询性能较差,此时ES具有明显优势

随着搜索量的增加,Solr的劣势愈发明显,ES无明显变化

总结
1、ES基本是开箱即用,非常简单。Solr安装略微复杂 2、Solr 利用Zookeeper进行分布式管理,而Elasticsearch 自身带有分布式协调管理功能。 3、Solr 支持更多格式的数据,比如JSON、XML、 CSV ,而Elasticsearch仅支持JSON文件格式。 4、Solr 官方提供的功能更多,而Elasticsearch本身更注重于核心功能,高级功能多有第三方插件提供,例如图形化界面需要kibana友好支撑 5、Solr 查询快,但更新索引时慢(即插入删除慢) ,用于电商等查询多的应用; ●ES建立索引快(即查询慢) ,即实时性查询快,用于facebook新浪等搜索。 ●Solr是传统搜索应用的有力解决方案,但Elasticsearch 更适用于新兴的实时搜索应用。 6、Solr比较成熟,有一个更大,更成熟的用户、开发和贡献者社区,而Elasticsearch相对开发维护者较少,更新太快,学习使用成本较高。
Elasticsearch安装和head安装
注意:java版本至少为JDK1.8或以上,需要node.js
下载地址:https://www.elastic.co/cn/downloads/
历史版本下载:https://www.elastic.co/cn/downloads/past-releases/
Elasticsearch目录介绍
bin 相关启动文件
config 配置文件
log4j2.properties 日志配置文件
jvm.options java虚拟机配置文件
elasticsearch.yml ES配置文件(默认端口:9200,这里在tpot中,docker默认分配的是1111,需要再映射到9200才行)
lib 相关jar包
logs 日志
modules 功能模块
plugins 插件
启动
双击bin下的elasticsearch.bat()即可
测试访问
访问其暴露的端口进行验证(http://127.0.0.1:9200/)

安装可视化界面Elasticsearch-head
githup:https://github.com/mobz/elasticsearch-head
打开安装文件目录:cnpm install 安装插件
启动head:npm run start
解决跨域问题
配置elasticsearch,打开elasticsearch.yml文件,在最后一行加入(注意yalm语法,冒号后要加一个空格)
http.cors.enabled: true
http.cors.allow-origin: "*"
重启es

Kibana的安装
了解ELK
ELK是Elasticsearch、Logstash、Kibana三大开源框架首字母大写简称。市面上也被成为Elastic Stack。其中Elasticsearch是一个基于Lucene、分布式、通过Restful方式进行交互的近实时搜索平台框架。像类似百度、谷歌这种大数据全文搜索引擎的场景都可以使用Elasticsearch作为底层支持框架,可见Elasticsearch提供的搜索能力确实强大,市面上很多时候我们简称Elasticsearch为es。Logstash是ELK的中央数据流引擎,用于从不同目标(文件/数据存储/MQ)收集的不同格式数据,经过过滤后支持输出到不同目的地(文件/MQ/redis/elasticsearch/kafka等 )。Kibana可以将elasticsearch的数据通过友好的页面展示出来,提供实时分析的功能。
市面上很多开发只要提到ELK能够一致说出它是一个日志分析架构技术栈总称,但实际上ELK不仅仅适用于日志分析,它还可以支持其它任何数据分析和收集的场景,日志分析和收集只是更具有代表性。并非唯一性。

Kibana安装
Kibana是一个针对Elasticsearch的开源分析及可视化平台,用来搜索、查看交互存储在Elasticsearch索引中的数据。使用Kibana ,可以通过各种图表进行高级数据分析及展示。Kibana让海量数据更容易理解。它操作简单,基于浏览器的用户界面可以快速创建仪表板( dashboard ))实时显示Elasticsearch查询动态。设置Kibana非常简单。无需编码或者额外的基础架构,几分钟内就可以完成Kibana安装并启动Elasticsearch索引监测。
Kibana版本下载:https://www.elastic.co/cn/downloads/past-releases#kibana
选择和es版本一致的,解压即可
双击kibana.bat即可

浏览器访问

开发工具!( Post、curl、head、谷歌浏览器插件测试!)

汉化
在config目录下的kibana.yml修改配置,重启即可

浏览器访问即可

ES核心概念
Elasticsearch是面向文档的一种数据库,这意味着其不再需要行列式的表格字段约束。
ES会存储整个构造好的数据或文档,然而不仅仅是储存数据,这使得文档中每个数据可以被标识,进而可以被检索。在ES中,执行index,search,sort或过滤文档等操作都不是传统意义上的行列式的数据。
ES从根本上对数据的不同思考方式也正是他能应对复杂数据结构的全文检索的原因之一。
elasticsearch是面向文档,关系行数据库和elasticsearch客观的对比!
| Relational DB | Elasticsearch |
|---|---|
| 数据库(database) | 索引(index) |
| 表(tables) | 类型(types,新版本中逐步弃用) |
| 行(rows) | 文档(documents) |
| 字段(columns) | 字段(file) |
elasticsearch(集群)中可以包含多个索引(数据库),每个索引中可以包含多个类型(表),每个类型下又包含多个文档(行),每个文档中又包含多个字段(列)。
物理设计︰
elasticsearch在后台把每个索引划分成多个分片,每分分片可以在集群中的不同服务器间迁移
一个人就是一个集群!默认的集群名称就是Elasticsearch

逻辑设计:
一个索引类型中,包含多个文档,比如说文档1,文档2。当我们索引一篇文档时,可以通过这样的一各顺序找到它:索引类型文档ID,通过这个组合我们就能索引到某个具体的文档。注意:ID不必是整数,实际上它是个字符串。
文档
之前说elasticsearch是面向文档的,那么就意味着索引和搜索数据的最小单位是文档,elasticsearch中,文档有几个重要属性:
·自我包含,一篇文档同时包含字段和对应的值,也就是同时包含key:value !
·可以是层次型的,一个文档中包含自文档,复杂的逻辑实体就是这么来的!{就是一个json对象! fastjson进行自动转换!}
.灵活的结构,文档不依赖预先定义的模式,我们知道关系型数据库中,要提前定义字段才能使用,在elasticsearch中,对于字段是非常灵活的,有时候,我们可以忽略该字段,或者动态的添加一个新的字段。
尽管我们可以随意的新增或者忽略某个字段,但是,每个字段的类型非常重要,比如一个年龄字段类型,可以是字符串也可以是整形。因为elasticsearch会保存字段和类型之间的映射及其他的设置。这种映射具体到每个映射的每种类型,这也是为什么在
elasticsearch中,类型有时候也称为映射类型。
类型
类型是文档的逻辑容器,就像关系型数据库一样,表格是行的容器。类型中对于字段的定义称为映射,比如 name映射为字符串类型。我们说文档是无模式的,它们不需要拥有映射中所定义的所有字段,比如新增一个字段,那么elasticsearch是怎么做的呢?elasticsearch会自动的将新字段加入映射,但是这个字段的不确定它是什么类型,elasticsearch就开始猜,如果这个值是18,那2elasticsearch会认为它是整形。但是elasticsearch也可能猜不对,所以最安全的方式就是提前定义好所需要的映射,这点跟关系型数据库殊途同归了,先定义好字段,然后再使用,别整什么幺蛾子。
索引
索引是映射类型的容器,elasticsearch中的索引是一个非常大的文档集合。索引存储了映射类型的字段和其他设置。然后它们被存储到了各个分片上了。我们来研究下分片是如何工作的。
物理设计︰节点和分片如何工作

一个集群至少有一个节点,而一个节点就是一个elasricsearch进程,节点可以有多个索引默认的,如果你创建索引,那么索引将会有个5个分片( primary shard ,又称主分片)构成的,每一个主分片会有一个副本( replica shard ,又称复制分片)

上图是一个有3个节点的集群,可以看到主分片和对应的复制分片都不会在同一个节点内,这样有利于某个节点挂掉了,数据也不至于丢失。实际上,一个分片是一个Lucene索引,一个包含倒排索引的文件目录,倒排索引的结构使得elasticsearch在不扫描全部文档的情况下,就能告诉你哪些文档包含特定的关键字。
倒排索引
elasticsearch使用的是一种称为倒排索引的结构 ,采用Lucene倒排索引作为底层。这种结构适用于快速的全文搜索,一个索引由文档中所有不重复的列表构成,对于每一个词,都有一个包含它的文档列表。
例如,现在有两个文档,每个文档包含如下内容:
study every day, good good up to forever #文档1包含的内容
To forever, study every day, good good up #文档2包含的内容
为了创建倒排索引,我们首先要将每个文档拆分成独立的词(或称为词条或者tokens) ,然后创建一个包含所有不重复的词条的排序列表,然后列出每个词条出现在哪个文档:(大小写要区分,重复单词也要加入)
| term | doc_1 | doc_2 |
|---|---|---|
| Study | 〇 | X |
| To | X | 〇 |
| forever | 〇 | 〇 |
| every | 〇 | 〇 |
| study | X | 〇 |
| day | 〇 | 〇 |
| good | 〇 | 〇 |
| up | 〇 | 〇 |
| to | 〇 | X |
| every | 〇 | 〇 |
现在,我们试图搜索to forever,只需要查看每个词条在对应文档是否出现即可。这里to和forever在doc1里面都有,而doc2中to没有,所以搜索结果为:doc1的权重更大,即“to forever”更可能出现在doc1
| term | doc_1 | doc_2 |
|---|---|---|
| to | 〇 | X |
| forever | 〇 | 〇 |
| SUM | 2 | 1 |
这里的“权重”,即为文档的score,es搜索完成会对分数进行自动统计
两个文档都匹配,但是第一个文档比第二个匹配程度更高。如果没有别的条件,这两个包含关键字的文档都将返回。
再来看一个示例,比如我们通过博客标签来搜索博客文章。那么倒排索引列表就是这样的一个结构

如果要搜索含有python标签的文章,那相对于查找所有原始数据而言,查找倒排索引后的数据将会快的多。只需要查看标签这一栏,然后获取相关的文章ID即可。完全过滤掉无关的所有数据,提高效率!
elasticsearch的索引和Lucene的索引对比
在elasticsearch中,索引这个词被频繁使用,这就是术语的使用。在elasticsearch中,索引被分为多个分片,每份分片是一个Lucene的索引。所以**一个elasticsearch索引是由多个Lucene索引组成的。**别问为什么,谁让elasticsearch使用Lucene作为底层呢!如无特指,说起索引都是指elasticsearch的索引。
IK分词器
什么是IK分词器?
分词:即把一段中文或者别的划分成一个个的关键字,我们在搜索时候会把自己的信息进行分词,会把数据库中或者索引库中的数据进行分词,然后进行一个匹配操作,默认的中文分词是将每个字看成一个词,比如“我爱黎明”会被分为"我","爱","“黎","明" 。这显然是不符合要求的,所以我们需要安装中文分词器IK来解决这个问题。
IK提供了两个分词算法: ik. smart和ik_max_ word
其中ik_smart为最少切分, ik _max_word为最细粒度划分
ElasticSearch内置分词器
-
standard Analyzer - 默认分词器,按词切分,小写处理
-
simple Analyzer - 按照非字母切分(符号被过滤),小写处理
-
stop Analyzer - 小写处理,停用词过滤(the 、a 、is )
-
whitespace Analyzer - 按照空格切分,不转小写
-
keyword Analyzer - 不分词,直接将输入当做输出
-
patter Analyzer - 正则表达式,默认\W+(非字符分割)
-
language - 提供了30多种常见语言的分词器
内置分词器对中文的处理方式很不友好,处理方式为:一个字一个词
- 查看字段使用了哪一种分词器
GET schooldb/student/1/_termvectors?fields=stuName/
- 查看分词器是怎么分词的
POST _analyze/
{
"analyzer": "standard",
"text": "helloword"
}
-
使用ik分词器
ik分词器提供了两种分词模式:ik_smart (粗粒度的) 、ik_max_word(细粒度的)
POST _analyze/ { "analyzer": "ik_smart", "text": "长沙市岳麓区" } POST _analyze/ { "analyzer": "ik_max_word", "text": "长沙市岳麓区" } -
设置全局默认的分词器
PUT _template/rtf { "template":"*", "settings":{ "index":{ "analysis": { "analyzer": { "default": { "type": "ik_max_word" } } } } } }只能在创建索引的时候设置分词器,不能创建索引后修改
-
head插件中查看所使用的分词器
安装IK分词器
下载:https://github.com/medcl/elasticsearch-analysis-ik/releases?page=5
安装:解压后放入es的插件目录plugins下即可

重启es加载插件

可使用以下命令查看插件列表
elasticsearch-plugin list

使用Kibana测试
其中ik_smart为最少切分

ik_max_word为最细粒度划分!穷尽词库的可能!I字典! |

如果想自己自定义分词器,可以自己添加分词配置

重启es即可
REST风格
一种软件架构风格,而不是标准,只是提供了一组设计原则和约束条件。它主要用于客户端和服务器交互类的软件。基于这个风格设计的软件可以更简洁,更有层次,更易于实现缓存等机制。
即通过不同的命令实现不同的操作
基本的POST查询
编辑数据
POST schooldb/student/1
{
"id": 1,
"stuName": "zhang san",
"stuAddress": "长沙市岳麓区",
"stuAge": 18
}
POST schooldb/student/2
{
"id": 2,
"stuName": "lisi",
"stuAddress": "长沙市开福区",
"stuAge": 10
}
POST schooldb/student/3
{
"id": 3,
"stuName": "zhangsan2",
"stuAddress": "长沙市芙蓉区",
"stuAge": 30
}
POST schooldb/student/4
{
"id": 4,
"stuName": "wang liu",
"stuAddress": "长沙市开福区",
"stuAge": 23
}
POST schooldb/student/5
{
"id": 5,
"stuName": "wang wu",
"stuAddress": "长沙市望城区",
"stuAge": 40
}
- post查询所有
POST schooldb/student/_search/
{
"query":{
"match_all":{}
}
}
- post范围查询
from
查询前两条数据
POST schooldb/student/_search/
{
"query": {
"match_all": {}
},
"from": 0,
"size": 2
}
range(gt 大于 lt 小于 gte 大于等于 lte 小于等于)
查询年龄在30-100之间的学生
POST schooldb/student/_search/
{
"query": {
"range": {
"stuAge": {
"gte": 30,
"lte": 100
}
}
}
}
-
post查询排序
查询所有按照年龄降序排列
POST schooldb/student/_search/
{
"query": {
"match_all": {}
},
"sort": [
{
"stuAge": {
"order": "desc"
}
}
]
}
排序不能作用在text类型上
- post模糊查询 ??
POST schooldb/student/_search/
{
"query": {
"fuzzy": {
"stuName": {
"value": "x",
"fuzziness": 0
}
}
}
}
参考文档https://blog.csdn.net/weixin_52578409/article/details/110670697
- post match 和 term
POST schooldb/student/_search/
{
"query": {
"match": {
"stuAddress": "长沙市岳麓区"
}
}
}
POST schooldb/student/_search/
{
"query": {
"term": {
"stuAddress": "长沙市岳麓区"
}
}
}
match会分词,然后求并集,
但是term不分词,需要完全匹配才能被搜索到
match和term的区别参考文档:https://www.cnblogs.com/yjf512/p/4897294.html
- bool查询
1、must (must字段对应的是个列表,也就是说可以有多个并列的查询条件,一个文档满足各个子条件后才最终返回) and
2、should (只要符合其中一个条件就返回) or
3、must_not (与must相反,也就是说可以有多个并列的查询条件,一个文档各个子条件后才最终的结果都不满足) not
4、filter(条件过滤查询,过滤条件的范围用range表示,gt表示大于、lt表示小于、gte表示大于等于、lte表示小于等于)
POST schooldb/student/_search/
{
"query":{
"bool":{
"must":[
{
"match":{"stuAddress":"长沙"}
},
{
"range":{
"stuAge":{
"gt":23
}
}
}
]
}
}
}
基本REST命令关于索引的基本操作
| method | url地址 | 描述 |
|---|---|---|
| PUT | localhost:9200/索引名称/类型名称/文档id | 创建文档(指定文档id ) |
| POST | localhost:9200/索弓|名称/类型名称 | 创建文档(随机文档id ) |
| POST | localhost:9200/索引名称/类型名称/文档id/_ update | 修改文档 |
| DELETE | localhost:9200/索引名称/类型名称/文档id | 删除文档 |
| GET | localhost:9200/索引名称/类型名称/文档id | 查询文档(通过文档id) |
| POST | localhost:9200/索弓|名称/类型名称/_ search | 查询所有数据 |
基本测试
语法
注意:
1、创建的索引名要小写
2、es head中数据浏览不显示内容就换个浏览器试试
PUT /索引名/类型名(新版本逐步废弃)/文档ID
{
请求体
}
测试

使用head查看

指定字段的规则
常用的字段类型有:
●字符串类型 text、keyword ●数值类型 long,. integer, short, byte, double, float, half float, scaled float ●日期类型 date ●te布尔值类型 boolean ●二进制类型 binary.

通过get请求获取具体的信息

查看默认的类型

如果自己的文档字段没有指定,那么es 就会给我们默认配置字段类型!
扩展︰通过命令elasticsearch索引情况!通过get _cat/可以获得es的当前的很多信息!

修改使用POST

删除索引,DELETE
通过DELETE命令实现删除、根据你的请求来判断是删除索引还是删除文档记录!

基本REST命令关于文档的基本操作
基本操作
添加3条数据
PUT yuan/user/1
{
"name":"张三",
"age":29,
"desc":"aaa",
"tags":["看电视","玩游戏"]
}
--------------
PUT yuan/user/2
{
"name":"李四",
"age":59,
"desc":"bbb",
"tags":["打篮球","玩游戏"]
}
--------------
PUT yuan/user/3
{
"name":"王五",
"age":70,
"desc":"ccc",
"tags":["打篮球","旅游"]
}

查询数据
GET /yuan/user/1

更新操作
POST /yuan/user/1/_update
{
"doc":{
"name":"张思"
}
}

基本的简单查询
GET /yuan/user/1 #根据id来查询
查询全部
POST schooldb/student/_search/
{
"query": {
"match_all": {}
}
}
带条件查询
GET /yuan/user/_search?q=name:"李四" #待条件查询


复杂查询
新增一个4号用户
PUT yuan/user/4
{
"name":"张午",
"age":29,
"desc":"aaa",
"tags":["看电视","玩游戏"]
}
带条件查询模糊匹配
GET yuan/user/_search #查询带有张的用户
{
"query": {
"match": {
"name": "张"
}
}
}

过滤出指定的字段
GET yuan/user/_search
{
"query": {
"match": {
"name": "张"
}
},
"_source": ["name","desc"] #指定输出的字段名称
}

排序
GET yuan/user/_search
{
"query": {
"match": {
"name": "张"
}
},
"sort": [
{
"age": { #根据年龄进行排序
"order": "desc"
}
}
]
}

分页查询
GET yuan/user/_search
{
"query": {
"match": {
"name": "张"
}
},
"sort": [
{
"age": {
"order": "desc"
}
}
],
"from": 0, #起始页
"size": 1 #页大小
}

布尔值查询多条件
must ( and ),所有的条件都要符合where id = 1 and name = xxx
GET yuan/user/_search #多条件查询
{
"query": {
"bool": {
"must": [ #must并且的意思
{
"match": { #查询带有张的
"name": "张"
}
},{
"match": { #并且年龄等于10的
"age": "10"
}
}
]
}
}
}

should( or),所有的条件满足其一即可where id = 1 or name = xxx
GET yuan/user/_search
{
"query": {
"bool": {
"should": [ #should或者的意思,表示两个条件满足其一即可
{
"match": {
"name": "张" #满足名字带有张的
}
},{
"match": {
"age": "10" #或者年龄等于10的
}
}
]
}
}
}

**must_not不等于 **
GET yuan/user/_search
{
"query": {
"bool": {
"must_not": [ #must_not不等于的意思
{
"match": { #查询年龄不等于10 的用户
"age": 10
}
}
]
}
}
}

过滤器filter
GET yuan/user/_search
{
"query": {
"bool": {
"must": [
{
"match": {
"name": "张"
}
}
],
"filter": [
{
"range": {
"age": { #查询年龄大于11的用户
"gt": 11
}
}
}
]
}
}
}

gt大于
gte 大于等于
lt 小于
lte 小于等于!

匹配多个条件
GET yuan/user/_search
{
"query": {
"match": {
"tags": "游戏 旅游" #配置多个条件多个用空格隔开
}
}
}

精确查询
term查询是直接通过倒排索引指定的词条进程精确的查找的!|
关于分词:
term,直接查询精确的
match,会使用分词器解析!(先分析文档,然后在通过分析的文档进行查询!)
PUT testdb #新建一个testdb索引
{
"mappings": {
"properties": {
"name":{
"type": "text" #设置type的类型为text,可以拆分查询
},
"desc":{
"type": "keyword" #设置类型为keyword,不可拆分查询
}
}
}
}
PUT testdb/_doc/1 #给第一个索引新增数据
{
"name":"源2",
"desc":"yuan desc"
}
PUT testdb/_doc/2 #给第二个索引新增数据
{
"name":"源1",
"desc":"yuan2 desc"
}
GET _analyze
{
"analyzer": "keyword", #字符串不会被拆分
"text": "啊啊啊"
}

GET _analyze
{
"analyzer": "standard" #字符串会被拆分
, "text": "啊啊啊"
}

GET /testdb/_search
{
"query": {
"term": {
"name": "源" #可以拆分查询 text类型
}
}
}
GET /testdb/_search
{
"query": {
"term": {
"desc": "yuan desc" 不可以拆分查询 keyword类型
}
}
}


多个值匹配的值的精确查询
PUT testdb/_doc/3 #put值
{
"t1":"22",
"t2":"2001--1"
}
PUT testdb/_doc/4 #put值
{
"t1":"33",
"t2":"2001--1"
}
GET /testdb/_search
{
"query": {
"bool": {
"should": [
{
"term": { #满足t1等于22
"t1": "22"
}
},{
"term": {
"t1": "33" #或者t1等于33
}
}
]
}
}
}

高亮模式
GET /yuan/user/_search
{
"query": {
"match": {
"name": "张"
}
},
"highlight": {
"fields": {
"name":{} #设置name的张为高亮
}
}
}

自定义高亮
GET /yuan/user/_search
{
"query": {
"match": {
"name": "张"
}
},
"highlight": {
"pre_tags": "<p clas='key' style='color:red'>", #配置前缀
"post_tags": "</p>", #配置后缀
"fields": {
"name":{} #设置name的张为高亮
}
}
}
