2022-03-14 59243e86bd239cdb7140362c55540e3b 99+ 5 m 0.8 k

flink提交任务

1.web ui

https://blog.csdn.net/godelgnis/article/details/106051751

2.命令行

可以指定部署方式

https://nightlies.apache.org/flink/flink-docs-release-1.13/zh/docs/deployment/cli/

https://blog.csdn.net/weixin_42993799/article/details/106566037

1 参数必选 ： 
     -n,--container <arg>   分配多少个yarn容器 (=taskmanager的数量)  
2 参数可选 ： 
     -D <arg>                        动态属性  
     -d,--detached                   独立运行  
     -jm,--jobManagerMemory <arg>    JobManager的内存 [in MB]  
     -nm,--name                      在YARN上为一个自定义的应用设置一个名字  
     -q,--query                      显示yarn中可用的资源 (内存, cpu核数)  
     -qu,--queue <arg>               指定YARN队列.  
     -s,--slots <arg>                每个TaskManager使用的slots数量  
     -tm,--taskManagerMemory <arg>   每个TaskManager的内存 [in MB]  
     -z,--zookeeperNamespace <arg>   针对HA模式在zookeeper上创建NameSpace 
     -id,--applicationId <yarnAppId> YARN集群上的任务id，附着到一个后台运行的yarn session中
 
3 run [OPTIONS] <jar-file> <arguments>  
 
    run操作参数:  
    -c,--class <classname>  如果没有在jar包中指定入口类，则需要在这里通过这个参数指定  
    -m,--jobmanager <host:port>  指定需要连接的jobmanager(主节点)地址，使用这个参数可以指定一个不同于配置文件中的jobmanager  
    -p,--parallelism <parallelism>   指定程序的并行度。可以覆盖配置文件中的默认值。
 
4 启动一个新的yarn-session,它们都有一个y或者yarn的前缀
 
    例如：./bin/flink run -m yarn-cluster -yn 2 ./examples/batch/WordCount.jar 
    
    连接指定host和port的jobmanager：
    ./bin/flink run -m SparkMaster:1234 ./examples/batch/WordCount.jar -input hdfs://hostname:port/hello.txt -output hdfs://hostname:port/result1
 
    启动一个新的yarn-session：
    ./bin/flink run -m yarn-cluster -yn 2 ./examples/batch/WordCount.jar -input hdfs://hostname:port/hello.txt -output hdfs://hostname:port/result1
 
5 注意：命令行的选项也可以使用./bin/flink 工具获得。
 
6 Action "run" compiles and runs a program.
    
      Syntax: run [OPTIONS] <jar-file> <arguments>
      "run" action options:
         -c,--class <classname>               Class with the program entry point
                                              ("main" method or "getPlan()" method.
                                              Only needed if the JAR file does not
                                              specify the class in its manifest.
         -C,--classpath <url>                 Adds a URL to each user code
                                              classloader  on all nodes in the
                                              cluster. The paths must specify a
                                              protocol (e.g. file://) and be
                                              accessible on all nodes (e.g. by means
                                              of a NFS share). You can use this
                                              option multiple times for specifying
                                              more than one URL. The protocol must
                                              be supported by the {@link
                                              java.net.URLClassLoader}.
         -d,--detached                        If present, runs the job in detached
                                              mode
         -n,--allowNonRestoredState           Allow to skip savepoint state that
                                              cannot be restored. You need to allow
                                              this if you removed an operator from
                                              your program that was part of the
                                              program when the savepoint was
                                              triggered.
         -p,--parallelism <parallelism>       The parallelism with which to run the
                                              program. Optional flag to override the
                                              default value specified in the
                                              configuration.
         -q,--sysoutLogging                   If present, suppress logging output to
                                              standard out.
         -s,--fromSavepoint <savepointPath>   Path to a savepoint to restore the job
                                              from (for example
                                              hdfs:///flink/savepoint-1537).
 
7  Options for yarn-cluster mode:
         -d,--detached                        If present, runs the job in detached
                                              mode
         -m,--jobmanager <arg>                Address of the JobManager (master) to
                                              which to connect. Use this flag to
                                              connect to a different JobManager than
                                              the one specified in the
                                              configuration.
         -yD <property=value>                 use value for given property
         -yd,--yarndetached                   If present, runs the job in detached
                                              mode (deprecated; use non-YARN
                                              specific option instead)
         -yh,--yarnhelp                       Help for the Yarn session CLI.
         -yid,--yarnapplicationId <arg>       Attach to running YARN session
         -yj,--yarnjar <arg>                  Path to Flink jar file
         -yjm,--yarnjobManagerMemory <arg>    Memory for JobManager Container with
                                              optional unit (default: MB)
         -yn,--yarncontainer <arg>            Number of YARN container to allocate
                                              (=Number of Task Managers)
         -ynl,--yarnnodeLabel <arg>           Specify YARN node label for the YARN
                                              application
         -ynm,--yarnname <arg>                Set a custom name for the application
                                              on YARN
         -yq,--yarnquery                      Display available YARN resources
                                              (memory, cores)
         -yqu,--yarnqueue <arg>               Specify YARN queue.
         -ys,--yarnslots <arg>                Number of slots per TaskManager
         -yst,--yarnstreaming                 Start Flink in streaming mode
         -yt,--yarnship <arg>                 Ship files in the specified directory
                                              (t for transfer)
         -ytm,--yarntaskManagerMemory <arg>   Memory per TaskManager Container with
                                              optional unit (default: MB)
         -yz,--yarnzookeeperNamespace <arg>   Namespace to create the Zookeeper
                                              sub-paths for high availability mode
         -z,--zookeeperNamespace <arg>        Namespace to create the Zookeeper
                                              sub-paths for high availability mode

大数据基础组件 flink 使用

flink提交任务

2022-03-12 d8cee0e274ae9b92638d35caa51e4aaa 99+ 2 m 0.3 k

flink部署

Flink的部署方式是灵活的，跟Spark一样，支持Local，Standalone，Yarn，Mesos，Kubernetes

代码中好像不能指定部署方式，和spark不同

https://blog.csdn.net/qq_33689414/article/details/90671685

1 Local

最简单的启动方式，其实是不搭建集群，直接本地启动。本地部署非常简单，直接解压安装包就可以使用，不用进行任何配置；一般用来做一些简单的测试。

2 Standalone

会话模式，应用模式

区别在于jobmaster的启动时间点，会话预先启动，应用在作业提交启动

3 Yarn

1 会话 session

在会话模式下，我们需要先启动一个YARN session，这个会话会创建一个 Flink集群。

2 单作业 per-job

flink不会预先启动，在提交作业，才启动新的jobmanager

3 应用application

与单作业很相似

区别在于提交给yarn资源管理器的不是具体作业，而是整个应用（包含了多个作业）

4 Mesos

5 Kubernetes

大数据基础组件 flink 原理

flink部署

2022-03-12 3c6c49eb8ded8cb735cb9466d4c40c6f 99+ fast 0.0 k

Flink架构原理

1.Flink组件

1 JobManager

2 任务管理器（ TaskManager）

2.任务调度流程

大数据基础组件 flink 原理

Flink架构原理

2022-03-12 8a09dcb69c6902cdb625146d82a3bffd 99+ a minute 0.1 k

flink vs spark

数据模型
1 spark 采用 RDD 模型， spark streaming 的 DStream 实际上也就是一组组小批
数据 RDD 的集合
2 flink 基本数据模型是数据流，以及事件（ Event ）序列
运行时架构
1 spark 是批计算，将 DAG 划分为不同的 stage ，一个完成后才可以计算下一个
2 flink 是标准的流执行模式，一个事件在一个节点处理完后可以直接发往下一个节
点进行处理

大数据基础组件 flink 原理

flink vs spark

flink提交任务

flink部署

1 Local

2 Standalone

3 Yarn

4 Mesos

5 Kubernetes

Flink架构原理

1.Flink组件

1 JobManager

2 任务管理器（ TaskManager）

2.任务调度流程

flink vs spark

Recents

Categories

Archives

Tags

Subscribe for updates