Arganzheng's Blog

stay hungry, stay foolish

ElasticSearch字段排序

需求 如果我们需要根据一个字段进行排序,如何支持呢? 像日期、价格这些数值型的(日期底层其实是转换为数值),排序其实是很自然也是很简单的。但是如果是字符串类型的字段呢?有几个问题需要考虑: 分词对排序的影响 大小写、单复数之类区别 字符串类型的字段一般都需要进行搜索的,那么需要对其进行Analyzed。但是Analyzed的结果就是将该字符串解析为分散的token(term)。这样子,ES就不知道到底是根据那个term来排序,事实上根据哪一个都是错的,应该是整个字符串。所以为了对字符串类型字段进行排序,需要保存整个字符串为一个term——也就是说保存一个not_analyzed string。同时为了保证该字段能够被搜索,还要保存该字符串anal...

ElasticSearch的数据类型

ES使用JSON作为数据交互格式,所以简单来说,JSON支持的数据类型,ES都支持。 1. core simple field types String: string Whole number: byte, short, integer, long Floating point: float, double Boolean: boolean Date: date ES对于没有定义mapping的未知字段会采用dynamic mapping进行类型猜测,并且将其加入到type mapping中。这个行为可以通过 dynamic 配置项进行控制。 true: Add new fields dynamically — the def...

ElasticSearch的Analyzer

Analyzer在构建索引的时候,还有分析查询字符串(query string)时候会用到。 Lucene的Analyzer是一个pineline的机制,由一个 Tokenizer + N个 TokenFilter 构成,N>=0。Tokenizer之前还可以配置N个 CharFilter。 其中各个部件的职责如下: character filters Character filters are used to preprocess the string of characters before it is passed to the tokenizer. A character filter may be used to strip out HTML...

如何提高服务器并发处理能力

说明 以下内容为入门级介绍,意在对老技术作较全的总结而不是较深的研究。主要参考《构建高性能Web站点》一书。 目录 什么是服务器并发处理能力 怎样衡量服务器并发处理能力 吞吐率 压力测试 怎么提高服务器的并发处理能力 提高CPU并发计算能力 多进程 & 多线程 减少进程切换,使用线程,考虑进程绑定CPU 减少使用不必要的锁,考虑无锁编程 考虑进程优先级 关注系统负载 关注CPU使用率,除了用户空间和内核空间的CPU使用率以外,还要关...

select、poll和epoll简介

说明:本篇文章是网上各种资料杂烩而成。如有雷同,纯属自然。 select select功能介绍 select系统调用的功能是对多个文件描述符进行监视,当有文件描述符的文件读写操作完成,发生异常或者超时,该调用会返回这些文件描述符。 int select(int nfds, fd_set *readfds, fd_set *writefds,fd_set *exceptfds,struct timeval *timeout); select关键结构体 这里先介绍一些关键的结构体: typedef struct { unsigned long *in, *out, *ex; unsigned long *res_in, *res_out,...

静态资源服务器迁移MFS方案

背景 目前的静态资源以普通Linux文件系统(Ext3)的方式存放在05机器上,主要是图片和新闻(以及新闻附带的图片)。每半个小时更新一次。通过rsync + cron 脚本定时同步到01。01只是备份,不提供服务。随着静态资源的增加,静态服务器的压力比较大,而且读写服务是单点,虽然有冗余容灾,但是不能同时提供服务,不具有线性拓展性。一般来说海量的文件系统都需要使用分布式文件系统。具体参见海量图片存储思考。 目前的文件数量有1000w左右,基本都是图片和HTML文件。 关于MFS MFS是Moose File System的简称,与我们熟悉的fat,ntfs,ext3一样是一种文件系统(驼鹿文件系统)。与普通的文件系统不同,MFS是一种分布式的文件系统,类似...

服务器编程模型

多进程模型 1.fork子进程在accept阻塞等待连接。 业务和网络层分离为不同进程模型。 负载均衡模型,多个进程绑定不同的端口。 多线程模型 1.主线程在accept处阻塞,当有新连接时实时创建新线程处理,处理完关闭。 2.创建线程池,都在accept处阻塞,当有新连接时notify一个线程去处理,处理完归还。 3.线程(池)关联一个线程消息队列,主线程在accept处阻塞,将新连接放入消息队列,线程(池)读取线程消息队列处理。 Java最经典的处理就是一个链接一个线程处理: class Server implements Runnable { public void run() ...

Java NIO.2

五种IO模型 按照《Unix网络编程》的划分,IO模型可以分为下面五种: 阻塞IO: blocking I/O 进程处于阻塞模式时,让出CPU,进入休眠状态,直到数据到达并且被复制到应用程序缓冲区中或者发生错误才返回 Linux下的I/O操作默认是阻塞I/O,即open和socket创建的I/O都是阻塞I/O 非阻塞IO: nonblocking I/O 可以通过fcntl或者open时使用O_NONBLOCK参数,将fd设置为非阻塞的I/O 进程并不投入睡眠,而是立即返回一个错误 应用程序需要不停的轮询(polling)内核来检查是否I/O操作已经完成 ...

nginx URL rewrite与下载文件名称问题

背景 我们的APK官方下载链接原来是http://app.arganzheng.me/official/download?language=xxx。这个链接是请求到tomcat,然后在应用服务器中遍历某个目录,找到最新的apk版本,让用户下载。 /** * 下载APK。处理CDN的真正下载请求。其实应该是在静态资源服务器和nginx处理。 */ @RequestMapping("/download") public void downloadApk(HttpServletResponse response) { File file = getLatestApkFile(); if (file == null) { logger.error("No a...

Java NIO

WHAT is Java NIO 虽然说Java NIO的真正含义是Non-Blocking IO。但是实际上它的字面意义是Java New IO,在Java 1.4的时候引入,用于区分原来老的IO方式。整个新的IO API是为服务器设计的,只与服务器相关。 WHY NIO 1. 网络IO往往是性能瓶颈 与CPU和内存相比,甚至与磁盘相比,网络都很慢。CPU与主存之间的传输速度大概是6GB每秒。与之相比,磁盘的传输速度要慢的多,但是也能够达到150MB每秒。但是,当今最快的局域网的理论速度是每秒120MB,但是大多数LAN只支持这个速度的十分之一到百分之一。而通过公用的Internet传输的速度一般至少要比LAN的速度低一个数量级。随着时间的的推移,CPU、...

×