原创作者: Qieqie
阅读:2364次
评论:1条
更新时间:2011-05-26
Lucene中文分词 “庖丁解牛”
附件 为本人设计编写的组件,中文分词“庖丁解牛”,具有相当好的使用价值。。。
高效率:我的赛扬PC 1 秒解析 >>> 20000汉字的词语 (实际测试结果数据,可达1秒10万+汉字。)
高可维护性:使用“庖丁”隐喻,形象明晰
高灵活性,可扩展:OOD
对比:《终于突破中文分词的效率问题》http://www.lucene.org.cn/read.php?tid=54&fpage=2 他的效率为 6秒 解析2588汉字
2007-08-08:
由于庖丁解牛进行了一些调整和重构,这里的附件代码已经是"较旧"的,最新的下载地址:
http://code.google.com/p/paoding/downloads/list
SVN地址为:http://paoding.googlecode.com/svn/trunk/paoding-analysis/
同时也可以通过浏览器访问http://paoding.googlecode.com/svn/trunk/paoding-analysis/ 直接浏览代码。
最新的在JavaEye的发布帖子是:
http://www.iteye.com/topic/110148 中文分词 庖丁解牛 2.0.0 发布
1 楼 littleJava 2009-05-04 22:20