近日,Apache软件基金会宣布,华为贡献给Apache社区的开源项目CarbonData从Apache孵化器毕业,正式成为Apache顶级项目(TLP),这意味着华为从大数据开源社区的参与者变成了社区和生态的引领者之一。
CarbonData是一种大数据高效存储格式解决方案。针对当前大数据领域分析场景需求各异而导致的存储冗余问题,CarbonData提供了一种新的融合数据存储方案,以一份数据同时支持多种大数据应用场景,并与Apache社区的Hadoop、Spark等组件实现无缝集成。
华为从2013年开始研究CarbonData解决方案,并在2015年将该方案开源贡献给Apache社区。2016年6月,CarbonData全票通过进入Apache孵化器;2017年4月,经过来自华为、英特尔、Talend、交通银行、上汽、携程等众多公司资深架构师和开发人员的努力,CarbonData经过不到一年的时间,毕业成为Apache社区顶级项目。这标志着CarbonData成为大数据生态的标准数据格式之一,也标志着华为不仅能够参与Apache大数据开源代码贡献,且能够主导一个顶级开源项目。同时,这也是华为"源于开源、强于开源、回馈开源"战略的又一次成功实践。
基于华为公司对Apache开源社区核心技术的掌握,华为FusionInsight大数据平台成为了众多客户的优选合作伙伴。截止目前,华为FusionInsight大数据平台已经服务于全球40多个国家和地区的700多家客户,广泛应用于金融、政府、公共安全、运营商、教育、能源、交通、医疗等多个行业。
好文章,需要你的鼓励
牛津大学提出PHYSIFORMER,一种扩散变换器模型,通过三维网格顶点轨迹直接在世界坐标空间预测刚性与弹性物体的物理运动,一次性生成全序列轨迹,超越自回归基线。
随着医疗数据数字化与互操作性的进步,跨机构纵向患者数据的研究应用成为可能。本研究通过对20位领域专家的访谈,识别出8种数据收集方法,涵盖智能手机应用、结构化数据导出、区域/全国研究查询及聚合数据源等。研究发现,各方法均有其优缺点,无单一最优方案。参与者中介交换方式可绕过复杂治理安排,但存在数据缺口;全国性网络尚不支持研究查询。公共政策的持续推进将对该领域发展起关键作用。
研究发现主流奖励模型对同等质量答案给出差异悬殊的分数,并提出"奖励聚类"算法通过蒙特卡洛随机失活将连续分数离散化,在不重训模型的前提下有效减少AI训练中的奖励作弊现象。