首页 > 其他 > 详细

集思广益,有个几百万关键字的数组的文本匹配的算法

时间:2014-06-16 10:29:45      阅读:379      评论:0      收藏:0      [点我收藏+]

关键字 都是放在一个数组中的,譬如$keyword_arr=["key1","key2","example",......],大约有几百万甚至上千万的关键字,这些关键字已经按照优先级从前到后排列了,越靠前的关键字优先匹配,匹配的最多次数是$max次;目前采用for循环$keyword_arr数组,然后将关键字组装成‘/\\b(?:‘.$value.‘)\\b/i‘;正则来匹配文本内容$text;如果已经匹配了$max次了,就停止匹配。

 

   这个算法肯定是最低效的,大家有好的建议可以提出来,主要问题是关键字优先级有点麻烦

 

 

  php: 目前采用正则匹配:

            foreach ($keyword_arr as $key=>$value) {
                $pattern = ‘/\\b(?:‘.$value.‘)\\b/i‘;
                preg_match($pattern, $text, $match, PREG_OFFSET_CAPTURE);
                if ($match && trim($match[0][0]) != ‘‘ && !in_array(strtolower($match[0][0]), $match_keyword_arr)) {
                    $match_keyword_arr[] = strtolower($match[0][0]);
                    $count ++;
                    if ($count >= $max) {
                        break;
                    }
            }

集思广益,有个几百万关键字的数组的文本匹配的算法,布布扣,bubuko.com

集思广益,有个几百万关键字的数组的文本匹配的算法

原文:http://www.cnblogs.com/liuminghai/p/3783522.html

(0)
(0)
   
举报
评论 一句话评论(0
关于我们 - 联系我们 - 留言反馈 - 联系我们:wmxa8@hotmail.com
© 2014 bubuko.com 版权所有
打开技术之扣,分享程序人生!