导航:首页 > 数据处理 > 大数据中为什么使用用户的概念

大数据中为什么使用用户的概念

发布时间:2023-06-03 14:24:20

‘壹’ 大数据在互联网用户系统中的应用

大数据在互联网用户系统中的应用
但是对于今日的互联网和移动互联网,大数据的规模和应用深度早已不次于传统的电信、民航等行业,甚至超过不少。因此笔者还是想写些东西浅谈一下互联网的大数据应用,权当抛砖引玉,也希望更多的朋友参与交流和讨论。
首先,第一篇想谈一下互联网的用户系统。无论互联网还是移动互联网,本身具有很大的特性就是互联,所以我们都可以称之为互联网,或者说移动互联网是互联网的一个子集和延伸。
在传统的电信、民航、能源等行业,企业的客户和主体用户构成都是有身份ID的。比如电信行业中身份证登记的手机卡号,比如民航用户乘坐航班登机的身份证或护照信息等,这些信息可以作为基本的用户身份ID,便于企业对其用户、客户进行身份辨别,并对后续的用户行为进行跟踪和分析。传统企业所存储的用户信息的很大优势在于完整性,很多先天的比如姓名、性别、年龄甚至籍贯等真实的基础身份信息都可以简单获得。而在互联网上,用户的访问都是匿名的,即使用户在接入互联网的时候使用的登记信息是实名的,但那主要是提供给电信服务商和公共安全机构备案而用。普通的互联网网站在用户面前是完全透明的被"围观"的,这个状况在web1.0 的主要产品--门户网站中最为典型。到了web2.0 时代,互联网开始变得互动起来,用户从简单的匿名浏览,变成了可以通过注册身份参与信息的制造和流通。这个时候,诞生了这个时代在谈的互联网大数据应用中非常重要的一个非决定性条件--用户身份系统。为什么说是"非决定性条件"呢?因为,在这之前,大量的数据分析也是可以做的,但是由于对用户缺乏身份缺乏甄别,因此数据分析能够应用的场景和得到的数据都相对很有限,但并不代表不能做大数据分析。而web2.0的用户身份系统诞生,则使互联网某种程度上具有了和传统行业同样的用户身份记录系统,数据统计和分析都可以更精准和深入。其中,以腾讯QQ、新浪UC等PC桌面产品为代表的互联网早期产品,应该是建立了互联网更早的用户身份系统,我们也可以看到这些系统在其后续的web产品铺开时同样被继承了过来。
那么,互联网的用户身份系统,一般都具有哪些信息呢?
打开任何一个网站,我们都可以看到注册页面需要填写用户名/email,性别,年龄 等基本信息。当然,不同的网站和互联网产品有不同的用户资料细化的程度。拿现在比较流行的几款产品做比较,其他互联网产品大多类似:1.新浪微博中用户可以填写自己的昵称、头像、真实姓名、所在地、性别、生日、博客地址、email、QQ/MSN、自我介绍、用户标签、教育信息、职业信息……;2.腾讯QQ客户端上可以填写头像、昵称、个性签名、姓名、性别、英文名、生日、血型、生肖、故乡、所在地、邮编、电话、学历、职业、语言、手机……
看起来还真不少,那么网站要用户的这些信息会被干嘛用呢?
这里笔者刘三德认为主要有以下几点:1. 展示自我;2.作为唯一的身份ID用作用户身份区别;3.搜索和推荐相关;4.网站自身可以做用户分析和用户行为跟踪。展现自我放到第一位是因为这是从产品满足用户需求的角度决定的,用户资料的首要任务就是为了作为用户唯一的可识别身份标识展示自我。其次,搜索和推荐相关这一点笔者刘三德计划在后续用专门的篇章来写,此处简单理解即可。最后一点,也就是本文所关注的一点,就是用用户身份来做数据分析。涉及到的用户分析主要维度为用户资料和用户行为。同样,用户行为也计划在后续篇章专门来写,本文着重讨论一下用户资料的分析。
可能行业内的一些文章和老前辈的观点,数据首先要量大、其次要有高的复杂度,才可以称为大数据。但笔者认为,大数据在一维的层次上不一定具有很强的复杂度,大部分是由最简单的数据形式构成。就譬如用户资料,一个网站如果有一千万的注册用户,如果每个用户的资料具有6个有效字段,就是6000万的有效数据。而将这6000万的有效数据通过一层或者几层简单的统计叠加分析、交叉分析等,在计算上本身就具有了不小的复杂度。何况现今的互联网产品,尤其社交类产品如FACEBOOK,腾讯QQ、新浪微博等动辄上亿的注册用户,本身用户系统就是一个非常具有价值的大数据。[page]
通过分析用户系统可以得到什么呢?
当然,用户填写的注册资料中包含的资料,都是最基础的分析数据。还是用数据说话,如下图:

以上图片来自互联网
以上数据是第三方机构公布的,而且都是最简单的一维数据,我们可以看到很多家网站的用户资料对比(上面引用的部分数据来源也可为线上调查问卷等形式)。对于独立的一个网站来说,用户资料的分析当然只是局限在自己的网站范围之内。进入互联网web2.0时代以后,大家都开始更加重视用户和用户体验,对于网站自身用户的特征进行分析,可以更好的网站的用户特性分布,方便针对网站的用户群特点更有针对性的进行对应的产品设计和研发。比如通过了解用户的消费层次等,也可以更好的提供用户消费相关展示和服务。
那么,无用户身份信息的互联网是否不再大数据?--不用注册的用户身份系统的。
可能有的朋友会对这个话题存疑问,也可能有的朋友会惊恐,认为隐私泄露了,其实这里的应用也非常简单。在类似传统的web1.0 门户类以展示为主的互联网产品中,也是可以做数据的分析和挖掘的,而且也有比较成熟的方案。是否有朋友曾经经历过以下场景:在网络上搜索汽车、查了半天汽车资料,一个小时以后再随手打开的一个图书阅读网站上居然出现了"汽车广告".其实,即使我们没有在这些网站上注册,网络等搜索引擎本身还是可以为用户标识一个唯一的身份信息,虽然这个身份信息只是临时的,可能有效期也只有几天左右。但是,这依然是一种唯一的用户身份,只不过是记录的信息有限而已,但是仍然为用户行为分析提供了很大的帮助。感兴趣的朋友可以搜索"google adsense隐私政策" 进行相关了解,此处不在赘述。
用户资料系统方便了一系列的大数据挖掘
除了传统的互联网桌面端和web端产品,最近几年突飞猛进的移动互联网以及终端应用,基本也都有完备的用户信息系统。apple苹果公司做了app store,迄今为止的应用下载次数突破250亿次,而每一次的下载都需要使用唯一的用户ID,通过分析,苹果可能比你父母更加了解你想要什么--这属于用户行为分析范畴,后续将专门讨论。
总之,用户身份和资料的分析是互联网大数据分析中最基础的分析,用户身份系统在互联网的大数据时代,为后续的用户行为分析和对应的企业产品、服务设计提供了基石,也为更加深入的数据挖掘奠定了基础。

‘贰’ 大数据的内容和基本含义

“大数据”是近年来IT行业的热词,大数据在各个行业的应用逐渐变得广泛起来,如2014年的两会,我们听得最多的也是大数据分析,那么,什么是大数据呢,什么是大数据概念呢,大数据概念怎么理解呢,一起来看看吧。
1、大数据的定义。大数据,又称巨量资料,指的是所涉及的数据资料量规模巨大到无法通过人脑甚至主流软件工具,在合理时间内达到撷取、管理、处理、并整理成为帮助企业经营决策更积极目的的资讯。
2、大数据的采集。科学技术及互联网的发展,推动着大数据时代的来临,各行各业每天都在产生数量巨大的数据碎片,数据计量单位已从从Byte、KB、MB、GB、TB发展到PB、EB、ZB、YB甚至BB、NB、DB来衡量。大数据时代数据的采集也不再是技术问题,只是面对如此众多的数据,我们怎样才能找到其内在规律。
3、大数据的特点。数据量大、数据种类多、 要求实时性强、数据所蕴藏的价值大。在各行各业均存在大数据,但是众多的信息和咨询是纷繁复杂的,我们需要搜索、处理、分析、归纳、总结其深层次的规律。
4、大数据的挖掘和处理。大数据必然无法用人脑来推算、估测,或者用单台的计算机进行处理,必须采用分布式计算架构,依托云计算的分布式处理、分布式数据库、云存储和虚拟化技术,因此,大数据的挖掘和处理必须用到云技术。
5、大数据的应用。大数据可应用于各行各业,将人们收集到的庞大数据进行分析整理,实现资讯的有效利用。举个本专业的例子,比如在奶牛基因层面寻找与产奶量相关的主效基因,我们可以首先对奶牛全基因组进行扫描,尽管我们获得了所有表型信息和基因信息,但是由于数据量庞大,这就需要采用大数据技术,进行分析比对,挖掘主效基因。例子还有很多。
6、大数据的意义和前景。总的来说,大数据是对大量、动态、能持续的数据,通过运用新系统、新工具、新模型的挖掘,从而获得具有洞察力和新价值的东西。以前,面对庞大的数据,我们可能会一叶障目、可见一斑,因此不能了解到事物的真正本质,从而在科学工作中得到错误的推断,而大数据时代的来临,一切真相将会展现在我么面前。

‘叁’ 大数据时代,为什么要使用大数据

大数据是什么?是一种运营模式,是一种能力,还是一种技术,或是一种数据集合的统称?今天我们所说的“大数据”和过去传统意义上的“数据”的区别又在哪里?大数据的来源又有哪些?等等。当然,我不是专家学者,我无法给出一个权威的,让所有人信服的定义,以下所谈只是我根据自己的理解进行小结归纳,只求表达出我个人的理解,并不求全面权威。先从“大数据”与“数据”的区别说起吧,过去我们说的“数据”很大程度上是指“数字”,如我们所说的客户量,业务量,营业收入额,利润额等等,都是一个个数字或者是可以进行编码的简单文本,这些数据分析起来相对简单,过去传统的数据解决方案(如数据库或商业智能技术)就能轻松应对;而今天我们所说的“大数据”则不单纯指“数字”,可能还包括“文本,图片,音频,视频……”等多种格式,其涵括的内容十分丰富,如我们的博客,微博,轻博客,我们的音频视频分享,我们的通话录音,我们位置信息,我们的点评信息,我们的交易信息,互动信息等等,包罗万象。用正规的语句来概括就是,“数据”是结构化的,而“大数据”则包括了“结构化数据”“半结构化数据”和“非结构化数据”。关于“结构化”“半结构化”“非结构化”可能从字面上比较难理解,在此我试着用我的语言看能否形象点地表达出来:由于数据是结构化的,数据分析可以遵循一定现有规律的,如通过简单的线性相关,数据分析可以大致预测下个月的营业收入额;而大数据是半结构化和非结构化的,其在分析过程中遵循的规律则是未知的,它通过综合方方面面的信息进行模拟,它以分析形式评估证据,假设应答结果,并计算每种可能性的可信度,通过大数据分析我们可以准确找到下一个市场热点。 基于此,或许我们可以给“大数据”这样一个定义,“大数据”指的是收集和分析大量信息的能力,而这些信息涉及到人类生活的方方面面,目的在于从复杂的数据里找到过去不容易昭示的规律。相比“数据”,“大数据”有两个明显的特征:第一,上文已经提到,数据的属性是包括结构化、非结构化和半结构化数据;第二,数据之间频繁产生交互,大规模进行数据分析,并实时与业务结合进行数据挖掘。解决了大数据是什么,接下来还有一个问题,大数据的来源有哪些?或者这个问题这样来表达会更清晰“大数据的数据来源有哪些?”对于企业而言,大数据的数据来源主要有两部分,一部分来自于企业内部自身的信息系统中产生的运营数据,这些数据大多是标准化、结构化的。(若继续细化,企业内部信息系统又可分两类,一类是“基干类系统”,用来提高人事、财会处理、接发订单等日常业务的效率;另一类是“信息类系统”,用于支持经营战略、开展市场分析、开拓客户等。)传统的商业智能系统中所用到的数据基本上数据该部分。而另外一部分则来自于外部,包括广泛存在于社交网络、物联网、电子商务等之中的非结构化数据。这些非结构化数据由源于 Facebook、Twitter、LinkedIn 及其它来源的社交媒体数据构成,其产生往往伴随着社交网络、移动计算和传感器等新的渠道和技术的不断涌现和应用。具体包括了:如,呼叫详细记录、设备和传感器信息、GPS 和地理定位映射数据、通过管理文件传输协议传送的海量图像文件、Web 文本和点击流数据、科学信息、电子邮件等等。由于来源不同,类型不同的数据透视的是同一个事物的不同的方面,以消费客户为例,消费记录信息能透视客户的消费能力,消费频率,消费兴趣点等,渠道信息能透视客户的渠道偏好,消费支付信息能透视客户的支付渠道情况,还有很多,如,客户会否在社交网站上分享消费情况,消费前后有否在搜索引擎上搜索过相关的关键词等等,这些信息(或说数据)从不同的方面表达了客户的消费过程的方方面面。因此,一般来说,企业用以分析的数据来源越广越全面,其分析的结果就越立体,越接近于真实。因此,大数据分析意味着企业能够从不同来源的数据中获取新的洞察力,并将其与企业业务体系的各个细节相融合,以助力企业在创新或者市场拓展上有所突破。针对“数据量”这个话题,亚马逊CTO Vogels曾经说过,“在运用大数据时,你会发现数据越大,结果越好。为什么有的企业在商业上不断犯错?那是因为他们没有足够的数据对运营和决策提供支持。一旦进入大数据的世界,企业的手中将握有无限可能。”可以预料,在不远的未来,企业如何通过抓住用户获取源源不断的数据资产将会是一个新的兵家必争之地。在这个层面上,Facebook、Twitter、Google、Amazon,包括电信运营商等领先企业具有无可比拟的优势。在大数据的领域里是否数据量越大越好?很多时候我们写文章,并不是想要去重复某一个众所周知的事实,而更多的是想从另外一个角度试图去质疑那些已成事实的事实,并不是想要去推翻,而只是去看这个事实是否存在另外的可能性,虽然很多时候我的那些质疑会漏洞百出,并显得幼稚可笑,但我觉得一个事物的健康发展需要不同的声音,而这正是我们写文章的意义所在。所以,我现在问题是,在大数据的领域里是否数据量越大越好?对于这个问题,我觉得应该分两个层面来看,第一个层面是,对大数据这个整体而言,数据肯定是越大越好的,多元的数据能让不同行业,不同组织都可以从大数据中寻找到解决问题的方法,也是基于此,现在越来越多的企业组织通过不同的终端、应用或者其他手段去疯狂地收集多元的数据,大数据让人们能有足够的能力和视野将地球(包括地球上的一切)作为一个整体去看待,这是在从前无法想象的。第二个层面是,对于大数据的具体应用而言,数据量是否越大越好,我却有不同的看法。我的理解是,在大数据的实际应用中你用以分析的数据量越大,你能得到的东西就越多,而至于得到的那些东西是否是你所需要的,或者对你是否有价值的,没有人能保证。就如同树林里有100条路,每条路上都有一些你觉得有意思的东西,如果你有足够的时间,你可以走遍这100条路,收获很多有意思的小东西,但不是每一条路都会让你得到真正有价值的东西。经常做数据分析的朋友应该会有同感,在分析的过程中你会发现不同的数据通过不同的组合导入不同的分析模型会得到很多不同的结果,有时候会有一些很新鲜的结果被发现,这会让你很惊喜,但大部分这些新鲜的结果最后只会出现在你的微博里,而不会出现在正式的分析报告中,因为分析报告是为解决某一具体问题而存在的,旁枝末节太多会显得臃肿且容易混淆。所以,我认为,在大数据的具体应用面前,我们先要做的是把“大数据”这个概念忘掉,我们必须弄清楚到底想从大数据中得到什么,然后带着目的去收集有用的数据,输入至分析模型中,直接导向我们想要的结果。否则你将花费大量时间、资源成本去获取数据,分析数据。我们需要大数据应用是能够帮助解决问题的行为洞察,而不是试图研究每一条能够得到的信息。不得不说,大数据的世界太魔幻了,里面的诱惑很多,如果你不是带着明确的目标去应用,你很有可能被陷入在五光十色的诱惑中无法自拔。即使你走进了一座金山,最后你能带走的最多也只是你能提动的一小口袋。另外,这同时也揭示,为了避免应用者困在“大数据的金山”,大数据必须往下细化,针对不同行业不同领域的特定问题制定不同的解决工具,未来大数据将会遵循消费化模式,核心基础设施将作为服务或应用程序来提供。

‘肆’ 如何利用好大数据挖掘潜在用户

为什么要用大数据挖掘潜在用户?

随着互联网的发展以及消费市场竞争的加剧:新品牌、新赛道、新渠道、新营销打法层出不穷。在快速演化的市场格局下,如何建立竞争壁垒、持续保持增长,需要重新立足数字化时代新消费崛起的背景,以洞察消费者体验为核心,重塑品牌价值,缜密布局增长策略。

只有全面精细地挖掘消费者的心智变化,如消费者的年龄、性别、消费习惯、生活现状、兴趣点等等信息,才能为接下来的内部创新提供正确的方向。优质的消费体验是提升品牌忠诚度的关键,也是企业维持稳定盈利模式的重要基础。随着互联网的发展以及消费市场竞争的加剧,消费者的每一条社媒发布、每一次社交互动、 每一次线上购买, 都反映了消费习惯、态度和行为。收集、分析这些数据并制定行之有效的消费体验决策是企业的业务刚需,更是撬动增长的差异化打法。

如何确定目标消费人群?

传统市调——耗时、耗人力、成本高、样本数量有限,且存在受访者隐藏真实想法的可能。

社交媒体大数据——符合用户沟通和线上行为习惯,无需人力、数据可自动全天候采集,数据量和分析维度更丰富、更客观、可信度更高 。

传统的用户数据收集有以下挑战:

01 线上、线下顾客体验触点繁多,碎片化的信息分散于企业各部门,无法利用整合数据快速了解消费需求和顾客体验,赋能管理决策。

02 传统调研样本量小,执行周期长,统计结果往往滞后于消费趋势,难以转化为可执行洞察来赋能产品创新和营销增长。

03市场情报数据源单薄,难以应付快速演化的市场竞争格局,缺乏统一的工具进行竞品对标,无法做到知己知彼。

所以,如何全面了解目标人群,标签和分析

基于实时大数据和机器学习算法的消费体验洞察,是真正“以消费者为核心”组织企业资源配 置的有效解决方案。消费体验洞察能够帮助企业快速采集和理解消费者需求、产品口碑、竞品动态、 新品趋势和消费热点,进而驱动营销、研发、顾客体验、零售运营等职能部门的专业人士把握商业机遇,敏捷应对快速变化中的消费市场。

第一步,细分人群画像 —— 了解ta们是谁,在哪儿,喜欢什么?

最佳实践案例(食品饮料)

某国际知名连锁餐饮品牌希望深入了希望了解中国咖啡市场的核心消费群体及细分人群画像。 运用机器学习建模后,对该品牌及竞品相关的逾 120万条消费者评论和社媒、电商和短视频讨论展开聚类分析,梳理出四大核心消费人群。

DataTouch®️数据分析平台再结合行业品类分布数据,由分析师进一步深入分析出细分人群的饮用环境、口味、 包装不同痛点诉求,结合品牌优劣势和人群特点给出针对性建议,为品牌未来精准产品定位和沟通策略提供了有力的决策依据 。


第二步,基于细分人群画像,指引产品精准沟通策略,捕获机会细分赛道和差异化产品概念方向定位

在了解市场格局和产品创新方向后,客户希望了解目标趋势品类在核心创新方向的细分受众画像。运用机器学习建模后,对每个创新方向相关的近千万条消费者评论和社媒、电商和短视频讨论展开聚类分析,梳理出4-5个核心消费人群。

DataTouch®️数据分析平台再结合行业品类分布数据,品牌竞争格局和顾客体验满意度,由分析师进一步深入分析出细分人群赛道的生活方式、场景需求,市场份额,机会定位,和在每一个产品属性(功效、使用感受、产品形态、包装等)的NLP深度学习情感分析,提炼未满足的痛点诉求,结合品牌定位优劣势和人群特点给出创新产品的差异化建议,为品牌未来精准产品定位和沟通策略提供了有力的数据洞察驱动的决策依据。

‘伍’ 大数据是怎么定义的,大数据包括什么

大数据无疑是近些年来科技领域的一个重要概念,随着越来越多的企业开始逐渐参与到大数据产业链中,大数据自身的定义也在不断得到丰富和发展。
要想定义大数据,可以从以下三个方面来进行定义:
第一:大数据重新定义了数据的价值。大数据既代表了技术,同时也代表了一个产业,更代表了一个发展的趋势。大数据技术指的是围绕数据价值化的一系列相关技术,包括数据的采集、存储、安全、分析、呈现等等;大数据产业指的是以大数据技术为基础的产业生态,大数据的产业生态目前尚未完善,还有较大的发展空间;发展趋势指的是大数据将成为一个重要的创新领域。
第二:大数据为智能化社会奠定了基础。人工智能的发展需要三个基础,分别是数据、算力和算法,所以大数据对于人工智能的发展具有重要的意义。目前在人工智能领域之所以在应用效果上有较为明显的改善,一个重要的原因是目前有了大量的数据支撑,这会全面促进算法的训练过程和验证过程,从而提升算法的应用效果。
第三:大数据促进了社会资源的数据化进程。大数据的发展使得数据产生了更大的价值,这个过程会在很大程度上促进社会资源的数据化进程,而更多的社会资源实现数据化之后,大数据的功能边界也会得到不断的拓展,从而带动一系列基于大数据的创新。
最后,大数据之所以重要,一个重要的原因是大数据开辟了一个新的价值领域,大数据将逐渐成为一种重要的生产材料,甚至可以说大数据将是智能化社会的一种新兴能源。

阅读全文

与大数据中为什么使用用户的概念相关的资料

热点内容
要想扎针技术好应该怎么做 浏览:597
二手房买卖交易流程是什么 浏览:939
充红包银行拒绝交易怎么回事 浏览:195
抖音数据清空了怎么恢复 浏览:470
技术学院指哪些 浏览:516
开店做什么生意好加盟代理 浏览:31
增益开关技术是什么 浏览:499
隐藏的程序什么也看不见 浏览:819
工程技术专业能考什么证书 浏览:360
百能的不锈钢橱柜市场什么价位 浏览:209
三岔口菜市场在哪里 浏览:309
跳蚤市场图书怎么做 浏览:235
七月份的数据有什么用 浏览:580
废锡渣多少钱一公斤市场价 浏览:562
淘手游交易金额多少才能立案 浏览:782
如何做好带货小程序 浏览:77
2020年周边有哪些新建农贸市场 浏览:284
涂料的产品怎么样 浏览:584
怎么多循环一次程序 浏览:160
大商所交易系统是什么 浏览:388