澳门新浦京娱乐场网站-www.146.net-新浦京娱乐场官网
做最好的网站

php利用scws达成mysql全文字笔迹查验索效果的章程

使用scws组件分词和phpanalysis分词类实现简单的php分词搜索

一、SCWS简介

本文实例讲述了php利用scws实现mysql全文搜索功能的方法。分享给大家供大家参考。具体方法如下:

 

关键字:php  分词  搜索

SCWS 是 Simple Chinese Word Segmentation 的首字母缩写(即:简易中文分词系统)。
这是一套基于词频词典的机械式中文分词引擎,它能将一整段的中文文本基本正确地切分成词。 词是中文的最小语素单位,但在书写时并不像英语会在词之间用空格分开, 所以如何准确并快速分词一直是中文分词的攻关难点。
SCWS 采用纯 C 语言开发,不依赖任何外部库函数,可直接使用动态链接库嵌入应用程序, 支持的中文编码包括 GBK、UTF-8 等。此外还提供了 PHP 扩展模块, 可在 PHP 中快速而方便地使用分词功能。
分词算法上并无太多创新成分,采用的是自己采集的词频词典,并辅以一定的专有名称,人名,地名, 数字年代等规则识别来达到基本分词,经小范围测试准确率在 90% ~ 95% 之间, 基本上能满足一些小型搜索引擎、关键字提取等场合运用。首次雏形版本发布于 2005 年底。
SCWS 由 hightman 开发, 并以 BSD 许可协议开源发布,源码托管在 github。

scws这样的中文分词插件比较不错,简单的学习了一下,它包涵一些专有名称、人名、地名、数字年代等规则集合,可以直接将语句按这些规则分开成一个一个关键词,准确率在90%-95%之间,按照安装说明把scws的扩展放入php的扩展目录里,下载规则文件和词典文件,并在php配置文件中引用它们,就可以用scws进行分词了.

一、**SCWS了解一下**:

什么是scws:

二、scws安装

1) 修改 php 扩展代码以兼容支持 php 5.4.x

SCWS 是 Simple Chinese Word Segmentation 的首字母缩写(即:简易中文分词系统)。

SCWS 是 Simple Chinese Word Segmentation 的首字母缩写(即:简易中文分词系统)。

复制代码 代码如下:

2) 修正 php 扩展中 scws_get_tops 的 limit 参数不允许少于 10 的问题

这是一套基于词频词典的机械式中文分词引擎,它能将一整段的中文文本基本正确地切分成词。 词是中文的最小语素单位,但在书写时并不像英语会在词之间用空格分开, 所以如何准确并快速分词一直是中文分词的攻关难点。

这是一套基于词频词典的机械式中文分词引擎,它能将一整段的中文文本基本正确地切分成词。 词是中文的最小语素单位,但在书写时并不像英语会在词之间用空格分开, 所以如何准确并快速分词一直是中文分词的攻关难点。

# wget -c
# tar jxvf scws-1.2.1.tar.bz2
# cd scws-1.2.1
# ./configure --prefix=/usr/local/scws
# make && make install

3) libscws 增加 scws_fork() 从既有的 scws 实例产生分支并共享词典/规则集,主要用于多线程开发.

SCWS 采用纯 C 语言开发,不依赖任何外部库函数,可直接使用动态链接库嵌入应用程序, 支持的中文编码包括 GBK、UTF-8 等。此外还提供了 PHP 扩展模块, 可在 PHP 中快速而方便地使用分词功能。

SCWS 采用纯 C 语言开发,不依赖任何外部库函数,可直接使用动态链接库嵌入应用程序, 支持的中文编码包括 GBK、UTF-8 等。此外还提供了 PHP 扩展模块, 可在 PHP 中快速而方便地使用分词功能。

三、scws的PHP扩展安装

4) 新增部分版本的 win32 的 dll 扩展

分词算法上并无太多创新成分,采用的是自己采集的词频词典,并辅以一定的专有名称,人名,地名, 数字年代等规则识别来达到基本分词,经小范围测试准确率在 90% ~ 95% 之间, 基本上能满足一些小型搜索引擎、关键字提取等场合运用。首次雏形版本发布于 2005 年底。

分词算法上并无太多创新成分,采用的是自己采集的词频词典,并辅以一定的专有名称,人名,地名, 数字年代等规则识别来达到基本分词,经小范围测试准确率在 90% ~ 95% 之间, 基本上能满足一些小型搜索引擎、关键字提取等场合运用。首次雏形版本发布于 2005 年底。

复制代码 代码如下:

PHP实例代码如下:

SCWS 由 hightman 开发, 并以 BSD 许可协议开源发布,源码托管在 github。

下载地址(需要下载SCWS规则集文件、xdb词典文件和对应版本的php_scws.dll扩展库)

# cd ./phpext
# phpize
# ./configure --with-php-config=/usr/local/php5410/bin/php-config
# make && make install
# echo "[scws]" >> /usr/local/php5410/etc/php.ini
# echo "extension = scws.so" >> /usr/local/php5410/etc/php.ini
# echo "scws.default.charset = utf-8" >> /usr/local/php5410/etc/php.ini
# echo "scws.default.fpath = /usr/local/scws/etc/" >> /usr/local/php5410/etc/php.ini

复制代码 代码如下:

参考官方文档:

四、词库安装

<?php
//实例化分词插件核心类
$so = scws_new();
//设置分词时所用编码
$so->set_charset('utf-8');
//设置分词所用词典(此处使用utf8的词典)
$so->set_dict('/path/dict.utf8.xdb');
//设置分词所用规则
$so->set_rule('/path/rules.utf8.ini ');
//分词前去掉标点符号
$so->set_ignore(true);
//是否复式分割,如“中国人”返回“中国+人+中国人”三个词。
$so->set_multi(true);
//设定将文字自动以二字分词法聚合
$so->set_duality(true);
//要进行分词的语句
$so->send_text(“欢迎来到火星时代IT开发”);
//获取分词结果,如果提取高频词用get_tops方法
while ($tmp = $so->get_result())
{
  print_r($tmp);
}
$so->close();
?>

 

安装php扩展

复制代码 代码如下:

注:如以上例子,输入的文字,词典,规则文件这三者的字符集必须统一,另外mysql 4.XX有的是不支持中文全文搜索的,可以存入关键字对应的区位码以方便全文搜索.

二、安装步骤:

将php_scws.dll的扩展库放入php目录下的ext目录中

# wget
# tar jxvf scws-dict-chs-utf8.tar.bz2 -C /usr/local/scws/etc/
# chown www:www /usr/local/scws/etc/dict.utf8.xdb

版本列表

  1. 取得 scws-1.2.3 的代码

然后再php.ini中添加以下配置,添加完成后重启

五、php实例代码。可以详细看下SCWS官方API说明

版本 类型 平台 性能 其它

wget

[scws]

复制代码 代码如下:

SCWS-1.1.x C 代码 *Unix*/*PHP* 准确: 95%, 召回: 91%, 速度: 1.2MB/sec

 

extension = php_scws.dll

//实例化分词插件核心类
 $so = scws_new();
 //设置分词时所用编码
 $so->set_charset('utf-8');
 //设置分词所用词典(此处使用utf8的词典)
 $so->set_dict('/usr/local/scws/etc/dict.utf8.xdb');
 //设置分词所用规则
 $so->set_rule('/usr/local/scws/etc/rules.utf8.ini ');
 //分词前去掉标点符号
 $so->set_ignore(true);
 //是否复式分割,如“中国人”返回“中国+人+中国人”三个词。
 $so->set_multi(true);
 //设定将文字自动以二字分词法聚合
 $so->set_duality(true);
 //要进行分词的语句
 $so->send_text(“欢迎来到火星时代IT开发”);
 //获取分词结果,如果提取高频词用get_tops方法
 while ($tmp = $so->get_result())
 {
     print_r($tmp);
 }
 $so->close();

PHP扩展分词速度: 250KB/sec [下载] [文档] [安装说明]

  1. 解开压缩包

scws.default.charset = gbk

返回数组结果说明:

php_scws.dll(1) PHP扩展库 Windows/PHP 4.4.x 准确: 95%, 召回: 91%,

[hightman@d1 ~]$ tar xvjf scws-1.2.3.tar.bz2

scws.default.fpath = "C:Program Filesscwsetc"

复制代码 代码如下:

php_scws.dll(2) PHP扩展库 Windows/PHP 5.2.x 准确: 95%, 召回: 91%,

 

注:extension的路径要确保能加载ext目录下的.dll扩展。

word   _string_ 词本身 
idf        _float_ 逆文本词频 
off         _int_ 该词在原文本路的位置 
attr       _string_ 词性

php_scws.dll(3) PHP扩展库 Windows/PHP 5.3.x 准确: 95%, 召回: 91%, 

  1. 进入目录执行配置脚本和编译

      scws.default.fpath的目录是分词规则文件的绝对目录

六、在线API
也可以使用在线API实现中文分词,API地址:

php_scws.dll(4) PHP扩展库 Windows/PHP 5.4.x 准确: 95%, 召回: 91%,

[hightman@d1 ~]$ cd scws-1.2.3

新建一个目录(C:Program Filesscws),将xdb文件放入。如图:

 

PSCWS23 PHP源代码 不限 (不支持UTF-8) 准确: 93%, 召回: 89%,

[hightman@d1 ~/scws-1.2.3]$ ./configure --prefix=/usr/local/scws ; make ; make install

 图片 1

您可能感兴趣的文章:

  • php实现的中文分词类完整实例
  • php实现scws中文分词搜索的方法
  • PHPAnalysis中文分词类详解
  • 使用Discuz关键词服务器实现PHP中文分词
  • PHP中文分词 自动获取关键词介绍
  • PHP中文分词的简单实现代码分享
  • 支持汉转拼和拼音分词的PHP中文工具类ChineseUtil

PSCWS4 PHP源代码 不限 准确: 95%, 召回: 91%,

注:这里和通用的 GNU 软件安装方式一样,具体选项参数执行 ./configure --help 查看。

将规则集文件(规则集文件在scws的全部源代码的压缩包中可以找到)放到etc目录下,如图:

希望本文所述对大家的php程序设计有所帮助。

常用选项为:--prefix=<scws的安装目录>

 图片 2

您可能感兴趣的文章:

  • 开源php中文分词系统SCWS安装和使用实例
  • PHPAnalysis中文分词类详解
  • 使用Discuz关键词服务器实现PHP中文分词
  • PHP中文分词 自动获取关键词介绍
  • PHP中文分词的简单实现代码分享
  • php实现scws中文分词搜索的方法

 

注:规则集和字典包的作用再官网里面很详细

  1. 顺利的话已经编译并安装成功到 /usr/local/scws 中了,执行下面命令看看文件是否存在

下面就来实际操作一下:

[hightman@d1 ~/scws-1.2.3]$ ls -al /usr/local/scws/lib/libscws.la

<?php

 

header("Content-Type:text/html;charset=utf-8");

  1. 试试执行 scws-cli 文件

$sc = scws_new();   //实例分词类

[hightman@d1 ~/scws-1.2.3]$ /usr/local/scws/bin/scws -h

$sc->set_charset('utf-8');      //设置分词时所用的编码

scws (scws-cli/1.2.3)

$sc->set_dict('C:Program Filesscwsdict.utf8.xdb');   //设置分词所用的字典包

Simple Chinese Word Segmentation - Command line usage.

$sc->set_rule('C:Program Filesscwsetcrules.utf8.ini');    //设置分词所用的规则

Copyright (C)2007 by hightman.

$sc->set_ignore(true);    //去掉标点符号后在分词

...

$sc->set_multi(true);           //复式分割

 

$sc->send_text('山东,厨具。');    //分词的语句

6 用 wget 下载并解压词典,或从主页下载然后自行解压再将 *.xdb 放入 /usr/local/scws/etc 目录中{笔者所用字符集是utf-8}

while($tmp[] = $sc->get_result()){         //获取分词结果

[hightman@d1 ~/scws-1.2.3]$ cd /usr/local/scws/etc

}

[hightman@d1 /usr/local/scws/etc]$ wget

//连接数据库

[hightman@d1 /usr/local/scws/etc]$ tar xvjf scws-dict-chs-utf8.tar.bz2

mysql_connect('localhost','root','root');

gbk下载:wget

mysql_select_db('tdmalls');

 

mysql_query('set names utf8');

7、进入源码目录的 phpext/ 目录

//组合sql

8、执行 phpize (在PHP安装目录的bin/目录下)

$sql = "select article_title from th_article where ";

9、执行 ./configure --with-scws=/usr/local/scws --with-php-config=/usr/local/php/bin/php-config (php-config绝对路径)

$len2 = count($tmp[0]);

10、 执行 make 后再执行 make test 查看是否有错,最后在执行 make install

for($j=0;$j<$len2;$j ){

11、 在 php.ini 中加入以下几行

      if($j == $len2-1){

[scws]

           $sql .= " article_title like '%".$tmp[0][$j]['word']."%'";

;未指定extension_dir的情况下, extension 写 scws.so 的绝对路径

      }else{

extension =scws.so

           $sql .= " article_title like '%".$tmp[0][$j]['word']."%' and ";

scws.default.charset = utf8

      }

scws.default.fpath = /usr/local/scws/etc

}

 

$res2 = mysql_query($sql);

中途错误汇总:

while($row[] = mysql_fetch_assoc($res2)){}

  • 出现如图错误图片 3 yum install gcc解决;
  • 出现如图错误图片 4 打开php.ini文件,取消禁用proc_open;

以上代码的分词的结果:

 

 图片 5

  •  有的人说重启php-fpm报错,那可能是因为你将[scws]的配置放在 php.ini末尾了!

以上代码组合的sql(sql的组合根据自己的情况来):

php利用scws达成mysql全文字笔迹查验索效果的章程,编译安装开源无偿普通话分词scws。 图片 6

以上代码搜索出来的结果:

 图片 7

这里关于scws的方法介绍的并不多,有需要的可以网上查找更多的使用方法

 

什么是phpanalysis无组件分词系统

下载地址的链接包含了这个系统的详细介绍,这个系统就是一个php的类,使用起来比较方便直接引入类文件就可以使用,但速度比scws这类组件形式的分词慢

下载地址:

使用方法比较简单,将下载的文件解压放入指定目录

 图片 8

然后再demo中引入这个类文件就可以使用了:

header("Content-type:text/html;charset=utf-8");

require_once './phpanalysis/phpanalysis.class.php';          //引入分词类文件

$fc = new PhpAnalysis();      //实例分词类(#注:这个步骤很耗时)

$str = '打造厨具';         

$fc->SetSource($str);           //设置待分词的字符

//设置生成的分词结果数据类型,2为词典词汇及单个中日韩简繁字符及英文

$fc->resultType = 2;          

$fc->StartAnalysis();      //开始分词

$arr = $fc->GetFinallyIndex();     //获取分词数组,键是词

$arr = implode(' ',array_keys($arr));

$arr = explode(' ',$arr);

//连接数据库

$m_db = mysql_connect('localhost','root','root');

mysql_select_db('tdmalls');

mysql_query('set names utf8');

//sql

$len = count(array_filter($arr));

$sql = "select article_title from th_article where ";

for($i=0;$i<$len;$i ){

      if($i == $len-1){

           $sql .= " article_title like '%".$arr[$i]."%'";

      }else{

           $sql .= " article_title like '%".$arr[$i]."%' and ";

      }

}

$res = mysql_query($sql);

while($row[] = mysql_fetch_assoc($res)){}

以上代码分出来的词的结果:

 图片 9

注:这个地方键才是分出来的词

最终搜索出来的结果:

 图片 10

虽然用起来方便也做了很多优化但速度还是不理想,实例化该类的时候很耗时。

该类的方法注释还算详细就不再介绍了。

 

本文由澳门新浦京娱乐场网站发布于数据库,转载请注明出处:php利用scws达成mysql全文字笔迹查验索效果的章程