机器学习和我关注的技术
导读基于关键词的复制网页算法 想前面的提到的算法都是基于这个文档的,对于大型的搜索引擎来说,在性能上有些差距,所以有些优化,针对是网页的关键词,或者网页的meta描述部分。所以,必须有以下的技术做支撑
基于关键词的复制网页算法 想前面的提到的算法都是基于这个文档的,对于大型的搜索引擎来说,在性能上有些差距,所以有些优化,针对是网页的关键词,或者网页的meta描述部分。所以,必须有以下的技术做支撑: 1、网页中出现的关键词(中文分词技术)以及每个关键词的权重(关键词密度); 2、提取meta descrīption或者每个网页的若干(比如:512)个字节的有效文字。 在以下算法描述中,我们约定几个信息指纹变量: Pi表示第i个网页; 该网页权重最高的N个关键词构成集合Ti={t...
免责声明:本文章由会员“何龙林”发布如果文章侵权,请联系我们处理,本站仅提供信息存储空间服务如因作品内容、版权和其他问题请于本站联系