<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>大数据 Spark - MatNoble 博客 - 生活 · 学习 · 数学 · 算法</title><link>https://blog.matnoble.top/tech/spark/</link><description>MatNoble 个人技术博客，聚焦大学数学可视化、算法思维与数据结构、LaTeX 科技论文与 Beamer 课件排版，以及大数据与分布式系统实践。记录从程序员到高校数学教师的深度技术思考与学术沉淀。</description><generator>Hugo 0.165.0 &amp; FixIt v0.4.5</generator><language>zh-CN</language><managingEditor>me@matnoble.top (MatNoble)</managingEditor><webMaster>me@matnoble.top (MatNoble)</webMaster><lastBuildDate>Tue, 08 Sep 2026 13:00:21 +0800</lastBuildDate><atom:link href="https://blog.matnoble.top/tech/spark/index.xml" rel="self" type="application/rss+xml"/><item><title>Spark on YARN 架构深度剖析：资源管理、计算调度与分布式部署实战</title><link>https://blog.matnoble.top/tech/spark/spark-on-yarn/</link><pubDate>Fri, 01 Sep 2023 21:30:00 +0800</pubDate><author>me@matnoble.top (MatNoble)</author><guid>https://blog.matnoble.top/tech/spark/spark-on-yarn/</guid><description>&lt;p&gt;&lt;strong&gt;摘要&lt;/strong&gt;：本文介绍了 Spark on YARN 架构 的基本原理和特点。文章首先介绍了 Hadoop YARN 架构 的两个核心组件：资源管理和计算调度，然后介绍了 Spark 架构 的主要组成部分和功能。文章最后总结了 Spark on YARN 架构 的优势和应用场景。&lt;/p&gt;</description></item><item><title>Spark RDD 分布式数学统计函数实战：求和、计数与均值优化</title><link>https://blog.matnoble.top/tech/spark/rdd-math-func/</link><pubDate>Sun, 27 Aug 2023 22:30:00 +0800</pubDate><author>me@matnoble.top (MatNoble)</author><guid>https://blog.matnoble.top/tech/spark/rdd-math-func/</guid><description>&lt;p&gt;&lt;a href="https://blog.matnoble.top/tech/spark/rdd/" target="_blank" rel="external nofollow noopener noreferrer"&gt;RDD（Resilient Distributed Datasets）是 Spark 中最基本的数据结构&lt;/a&gt;，是适合做..分布式..计算的。那如何在分布式系统中，对数据&#13;&#10;&#13;&#10;&lt;mark&gt;求和，计数，求均值&lt;/mark&gt;&#13;&#10;呢？&lt;/p&gt;</description></item><item><title>分布式计算基石：MapReduce 模型原理与 Spark 算子（Map/Reduce/Aggregate）实战指南</title><link>https://blog.matnoble.top/tech/spark/mapreduce/</link><pubDate>Sat, 26 Aug 2023 00:50:30 +0800</pubDate><author>me@matnoble.top (MatNoble)</author><guid>https://blog.matnoble.top/tech/spark/mapreduce/</guid><description>&lt;blockquote&gt;&#13;&#10; &lt;p&gt;MapReduce is a framework for processing parallelizable problems across large datasets using a large number of computers (nodes), collectively referred to as a cluster.&lt;/p&gt;&#13;&#10; &lt;footer&gt;&#13;&#10; &lt;strong&gt;&lt;/strong&gt;&#13;&#10; &#13;&#10; &#13;&#10; &lt;cite&gt;&#13;&#10; &lt;a href="https://en.wikipedia.org/wiki/MapReduce" title="https://en.wikipedia.org/wiki/MapReduce"&gt;MapReduce&lt;/a&gt; &#13;&#10; &lt;/cite&gt;&#13;&#10; &#13;&#10; &#13;&#10; &lt;/footer&gt;&#13;&#10;&lt;/blockquote&gt;&#13;&#10;&#10;&lt;p&gt;使用下面的示例来简单理解下 MapReduce 的核心思想：&lt;/p&gt;&#10;&lt;blockquote&gt;&#10;&lt;p&gt;&lt;strong&gt;目标&lt;/strong&gt;：将数据整体乘 2 后，再相加&lt;br&gt;&#10;&lt;em&gt;为了理解 MapReduce 思想，就不要想先加起来，再乘以 2 的方法了~&lt;/em&gt;&lt;/p&gt;&#10;&lt;/blockquote&gt;&#10;&lt;ol&gt;&#10;&lt;li&gt;&lt;code&gt;parallelize&lt;/code&gt; 方法将大任务分解成小任务，分发给 3 个工作节点&lt;/li&gt;&#10;&lt;li&gt;&lt;code&gt;map&lt;/code&gt; 方法将每个节点上的数据进行..相同..的加工（每个数都乘以 2）&lt;/li&gt;&#10;&lt;li&gt;&lt;code&gt;reduce&lt;/code&gt; 方法将加工后的数据全部加起来返回&lt;/li&gt;&#10;&lt;/ol&gt;&#10;&lt;figure class="caption-wrapper"&gt;&#10; &lt;a class="lightgallery" href="https://cdn.jsdelivr.net/gh/MatNoble/Images/win/map-reduce202308252336979.png" title="MapReduce" data-thumbnail="https://cdn.jsdelivr.net/gh/MatNoble/Images/win/map-reduce202308252336979.png" data-sub-html="&lt;h2&gt;MapReduce&lt;/h2&gt;"&gt;&#10; &lt;img class="caption" src="https://cdn.jsdelivr.net/gh/MatNoble/Images/win/map-reduce202308252336979.png"&#10; title="MapReduce"&#10; alt="MapReduce"&#10; style="max-width: 100%; width: 95%; margin: 0 auto; display: block;"&#10; loading="lazy"&gt;&#10; &lt;/a&gt;&lt;figcaption class="image-caption"&gt;&#10; &lt;span&gt;MapReduce&lt;/span&gt;&#10; &lt;/figcaption&gt;&lt;/figure&gt;&#10;&#10;&lt;p&gt;对应 Python 代码如下&lt;/p&gt;</description></item><item><title>深度解析 Spark RDD 五大核心特性：分布式存储、计算与依赖链条全图解</title><link>https://blog.matnoble.top/tech/spark/rdd/</link><pubDate>Thu, 24 Aug 2023 00:21:30 +0800</pubDate><author>me@matnoble.top (MatNoble)</author><guid>https://blog.matnoble.top/tech/spark/rdd/</guid><description>&lt;p&gt;RDD（Resilient Distributed Datasets）是 Spark 中最基本的数据结构，它是一个..不可变的分布式..数据集合，可以在集群中进行..并行处理..。&lt;/p&gt;</description></item></channel></rss>