第四十六章 搜索引擎的研发

一样。

这帮技术男们敲起代码来,都是没日没夜的。

没有打扰其他人的工作,他悄悄把王川叫出来,在自己办公室里,和他专门交流研发情况。

目前搜索引擎项目最大的困难在于,没有可供参考的对象。

虽然可以参考一些国外的资料和论文,但因为涉及到一些核心技术,是无法通过网络查找到的,都需要自行开发。

隋波点头表示同意。

这个时候google还不存在呢,要到9月份的时候,布林和佩奇才会在加州一个车库里开始创业。

百度更是没影的事儿,老李还在搜信里混呢。

现阶段,无论是国外的lycos、altavista、infoseek(搜信),雅虎搜索引擎;还是国内搜狐推出的所谓全中文搜索引擎,都还是以人工分类目录为主的网站检索服务。

说是搜索引擎,其实更像是目录导航网站……

尽管其中一些搜索引擎已经有了网页关键词检索、用户点击量排序等一些创新,但本质上,还是需要大量的人工编辑的目录式搜索引擎(directine)。

而隋波希望王川团队开发的,则是全新的,通过技术程序,自动在互联网上通过超链接网页进行全文检索的机器人搜索引擎(rine)。

这样的话,就需要从头做起,开发一整套完整的技术体系。

其中包括网络爬虫(webcrawler)服务、索引服务、缓存服务、日志服务等几大模块,各模块之间互相影响,构成了整个搜索引擎体系。

从开发量上,技术难度是远远大于目录式检索技术的。

首先说网络爬虫,也称网络蜘蛛(webspider),这项技术是基于web的自动化浏览程序,通过网页链接(url),爬虫不断的通过互联网中获得新的网页数据,下载页面数据形成后台数据库。

可以说,网络爬虫抓取数据是搜索引擎工作流程的第一步。

爬虫的体系架构直接关系到搜索引擎每天数据的采集量,而抓取策略则关系到搜索结果的数据质量,数据的更新策略则关系到系统资源的利用率。

这只是第一步,采集了大量数据信息之后,还需要通过自然语言处理(nlp),将文本信息分解为结构化数据和价值性数据。

这里面就又存在一个问题,目前国外的搜索引擎都是英文分词,而中文比较

相关阅读: 如果折断她的旗异世界魔王与召唤少女的奴隶魔术时钟机关之星Clockwork Planet弱角友崎同学寄生彼女砂奈锁锁美小姐@不好好努力下流梗不存在的灰暗世界人气妹妹与受难的我热情X冷颤无可挑剔的恋爱喜剧迷途猫剑刻的银乙女GIVE UP!我的宅女神水乳交揉!堕落邪恶组织,拥抱美少女大胜利!魔王的我与不死公主的戒指舞星洒落的雷涅席库尔妹妹X杀手X宅配便袭来!美少女邪神