一种文件聚类方法、装置、设备和介质
2025-02-23 13:26
No.1343212472911536128
技术概要
PDF全文
本技术公开了一种文件聚类方法、装置、设备和介质,由于该方法中获取预设时间段的日志文件中记录的每个被访问文件的标识信息和被访问时间,将标识信息作为主键并将被访问时间作为值,确定每个键值对,按照被访问时间对键值对进行排序,根据排序后的键值对中被访问时间之间的间隔,确定归属于每个组的键值对;针对归属于每个组的键值对,将该组中包含的每个键值对中记录的文件的标识信息标识的目标被访问文件保存在该组对应的文件集合中,由于基于排序后键值对进行聚类的方法提高了文件聚类结果与用户访问的关联性,从而提高了文件访问速度,且在确定归属于每个组的键值对,采用自下而上树形合并的方法进行聚类,使得聚类的时间复杂度降低。
背景技术
随着信息化时代的到来,大数据、云计算等新兴领域应运而生并迅速发展,在这样的背景下,在文件存储系统中,常采用分布式存储架构将数据组织成文件进行存储和访问。 现有技术中采用分布式存储架构进行存储时,文件的访问速度方面存在问题,为了提高文件的访问速度,现有技术采用基于特征提取的文件聚类实现,但在进行文件聚类时,由于需要确定每个文件与其他文件的相似度,从而导致消耗大量的计算资源,文件聚类的复杂度较高,并且文件聚类结果只与文件本身的内容特征或标题特征有关,而与用户访问的行为特征的关联性差,无法有效提高文件访问速度,降低用户的访问时延,因此如何对文件进行聚类以提高文件访问速度并降低文件聚类的复杂度就成为亟待解决的技术问题。
实现思路
阅读余下40%
技术概要为部分技术内容,查看PDF获取完整资料
该技术已申请专利,如用于商业用途,请联系技术所有人!
技术研发人员:
李想樊晓光曲秀超皇甫利刚杨隽康雨城
技术所属: 天翼云科技有限公司.
相关技术
FPGA实现硬件逻辑实时仿真的方法及装置 FPGA实现硬件逻辑实时仿真的方法及装置
基于API和数据库的动态标定方法 基于API和数据库的动态标定方法
一种虚拟机的沙箱引擎更新方法、装置、设备和介质 一种虚拟机的沙箱引擎更新方法、装置、设备和介质
频域响应仿真与测量数据处理方法及装置 频域响应仿真与测量数据处理方法及装置
服务数据节点迁移方法、装置、电子设备及存储介质 服务数据节点迁移方法、装置、电子设备及存储介质
配送控制方法、装置、服务器、智能柜及机器人 配送控制方法、装置、服务器、智能柜及机器人
适用于硬件电路的高精度压缩方法、装置及电子设备 适用于硬件电路的高精度压缩方法、装置及电子设备
融合多源信息的打击目标智能识别方法和系统 融合多源信息的打击目标智能识别方法和系统
水利对象关联关系建立方法 水利对象关联关系建立方法
问题解答方法、装置、介质和电子设备 问题解答方法、装置、介质和电子设备
技术分类
电信、广播电视和卫星传输服务 电信、广播电视和卫星传输服务
互联网软件服务 互联网软件服务
集成电路设计 集成电路设计
信息集成数字服务 信息集成数字服务
电气机械制造 电气机械制造
计算机、通信、电子设备制造 计算机、通信、电子设备制造
医药制造、生物基材料 医药制造、生物基材料
石油煤矿化学用品加工 石油煤矿化学用品加工
化学原料制品加工 化学原料制品加工
非金属矿物加工 非金属矿物加工
金属制品加工 金属制品加工
专用设备制造 专用设备制造
通用设备制造 通用设备制造
通用零部件制造 通用零部件制造
汽车制造业 汽车制造业
铁路、船舶、航天设备制造 铁路、船舶、航天设备制造
电力、热力生产和供应 电力、热力生产和供应
燃气生产和供应 燃气生产和供应
水生产和供应 水生产和供应
房屋建筑、土木工程 房屋建筑、土木工程
交通运输、仓储和邮政 交通运输、仓储和邮政
农、林、牧、渔业 农、林、牧、渔业
采矿业 采矿业
农副、食品加工 农副、食品加工
烟草、酒水加工 烟草、酒水加工
纺织皮具居家制品 纺织皮具居家制品
文教体娱加工 文教体娱加工
苏ICP备18062519号-5 © 2018-2025 【123技术园】 版权所有,并保留所有权利