CRF 中文分词开源版

我要开发同款
匿名用户2010年08月26日
34阅读
开发技术C/C++
所属分类程序开发、中文分词库
授权协议未知

作品详情

中文分词是互联网应用不可缺少的基础技术之一,也是其他语音和语言产品必不可少的技术组件。

自2003年第一届国际中文分词评测以来,由字构词的分词方法获得了压倒性优势,国内主要通过CRF++开源软件包来学习该分词方法,但是CRF++过于复杂的代码结构,导致了该算法的普及率。

CRF中文分词开源版仅仅包含CRF++软件包中分词解码器部分,简化了CRF++复杂代码结构,清除了分词解码器不需要的代码,大大提高了分词解码器的可读性和可懂度。同时为了方便学习者可视化跟踪和调试代码,在Windows平台下分别建立了VC6.0和VS2008两个工程文件,使得VC6.0用户和VS2008用户都能轻玩转中文分词。

开源包中的分词知识库较小,分词精度较低,仅供学习Crf分词算法使用,可以通过如下途径获得更高精度的分词知识库和更高速度的分词引擎DLL或OCX:1)致电nlptech360@gmail.com 或者langiner@gmail.com2)在博客https://langiner.blog.51cto.com留言3)在搜索引擎上搜索:极速分词

声明:本文仅代表作者观点,不代表本站立场。如果侵犯到您的合法权益,请联系我们删除侵权资源!如果遇到资源链接失效,请您通过评论或工单的方式通知管理员。未经允许,不得转载,本站所有资源文章禁止商业使用运营!
下载安装【程序员客栈】APP
实时对接需求、及时收发消息、丰富的开放项目需求、随时随地查看项目状态

评论