蘑菇街基于Docker的私有云实践

【编者的话】本次主要想分享一下过去一年时间里，我们在建设基于Docker的私有云实践过程中，曾经遇到过的问题，如何解决的经验，还有我们的体会和思考，与大家共勉。

内容

很高兴今天能在这里分享一下蘑菇街在生产环境中使用Docker的一些经历和经验。蘑菇街的私有云项目是2014年圣诞节期间上线的，从无到有，经过了半年多的发展，经历了3次大促，已经逐渐形成了一定的规模。

架构

集群管理

大家知道，Docker自身的集群管理能力在当时条件下还很不成熟，因此我们没有选择刚出现的Swarm，而是用了业界最成熟的 OpenStack，这样能同时管理Docker和KVM。我们把Docker当成虚拟机来跑，是为了能满足业务上对虚拟化的需求。今后的思路是微服务化，把应用进行拆分，变成一个个微服务，实现PaaS基于应用的部署和发布。

通过OpenStack如何管理Docker？我们采用的是OpenStack+novadocker＋Docker的架构模式。 novadocker是StackForge上一个开源项目，它做为nova的一个插件，通过调用Docker的RESTful接口来控制容器的启停等动作。

我们在IaaS基础上自研了编排调度等组件，支持应用的弹性伸缩、灰度升级等功能，并支持一定的调度策略，从而实现了PaaS层的主要功能。

同时，基于Docker和Jenkins实现了持续集成（CI）。Git中的项目如果发生了git push等动作，便会触发Jenkins Job进行自动构建，如果构建成功便会生成Docker Image并push到镜像仓库。基于CI生成的Docker Image，可以通过PaaS的API或界面，进行开发测试环境的实例更新，并最终进行生产环境的实例更新，从而实现持续集成和持续交付。

网络和存储

网络方面，我们没有采用docker默认提供的NAT网络模式，NAT会造成一定的性能损失。通过OpenStack，我们支持Linux bridge和openvswitch，不需要启动iptables，docker的性能接近物理机的95%。

容器的监控

监控方面，我们自研了container tools，实现了容器load值的计算，替换了原有的top，free，iostat，uptime等命令。这样业务方在容器内使用常用命令时看到的是容器的值，而不是整个物理机的。目前我们正在移植lxcfs到我们的平台上。

我们还在宿主机上增加了多个阈值监控和报警，比如关键进程监控，日志监控，实时pid数量，网络连接跟踪数，容器oom报警等等。

## 冗灾和隔离性 ##

冗灾和隔离性方面，我们做了大量的冗灾预案和技术准备。我们能够在不启动docker daemon的情况下，离线恢复docker中的数据。同时，我们支持docker的跨物理机冷迁移，支持动态的CPU扩容／缩容，网络IO磁盘IO的限速。

## 遇到的问题及解决方法 ##

接近一年不到的产品化和实际使用中我们遇到过各种的问题，使用Docker的过程也是不断优化Docker，不断定位问题，解决问题的过程。

我们现在的生产环境用的是CentOS6.5。曾经有个业务方误以为他用的docker容器是物理机，在docker容器里面又装了一个docker，瞬间导致内核crash，影响了同一台物理机的其他docker容器。

经过事后分析是2.6.32－431版本的内核对network namespace支持不好引起的，在docker内创建bridge会导致内核crash。upstream修复了这个bug，从2.6.32-431升级到2.6.32－504后问题解决。

还有一个用户写的程序有bug，创建的线程没有及时回收，容器中产生了大量的线程，最后在宿主机上都无法执行命令或者ssh登陆，报的错是"bash: fork: Cannot allocate memory"，但通过free看空闲的内存却是足够的。

经过分析，发现是内核对pid的隔离性支持不完善，pid_max(/proc/sys/kernel/pid_max)是全局共享的。当一个容器中的pid数目达到上限32768，会导致宿主机和其他容器无法创建新的进程。最新的4.3-rc1才支持对每个容器进行pid_max限制。

我们还观察到docker的宿主机内核日志中会产生乱序的问题。经过分析后发现是由于内核中只有一个log_buf缓冲区，所有printk打印的日志先放到这个缓冲区中，docker host以及container上的rsyslogd都会通过syslog从kernel的log_buf缓冲区中取日志，导致日志混乱。通过修改 container里的rsyslog配置，只让宿主机去读kernel日志，就能解决这个问题。

除此之外，我们还解决了device mapper的dm-thin discard导致内核crash等问题。

体会和思考

最后分享一下我们的体会和思考，相比KVM比较成熟的虚拟化技术，容器目前还有很多不完善的地方，除了集群管理，网络和存储，最重要的还是稳定性。影响稳定性的主要还是隔离性的不完善造成的，一个容器内引起的问题可能会影响整个系统。

容器的memcg无法回收slab cache，也不对dirty cache量进行限制，更容易发生OOM问题。还有，procfs上的一些文件接口还无法做到per－container，比如pid_max。

另外一点是对容器下的运维手段和运维经验的冲击。有些系统维护工具，比如ss，free，df等在容器中无法使用了，或者使用的结果跟物理机不一致，因为系统维护工具一般都会访问procfs下的文件，而这些工具或是需要改造，或是需要进行适配。

虽然容器还不完善，但是我们还是十分坚定的看好容器未来的发展。Kubernetes／Mesos，Hyper，criu，runc等容器相关的开源软件，都是我们关注的重点。

最后，以后大家想了解更多的话，可以关注我们的技术博客，今天的分享就这些，谢谢大家。

==============================================

Q&A

Q：请问容器间的负载均衡是如何做的？

A：容器间的负载均衡，更多是PaaS和SaaS层面的。我们的P层支持4层和7层的动态路由，通过域名的方式，或者名字服务来暴露出对外的接口。我们能够做到基于容器的灰度升级，和弹性伸缩。

Q：请问你们的Openstack是运行在Centos 6.5上的吗？

A: 是的，但是我们针对OpenStack和Docker依赖的包进行了升级。我们维护了内部的yum源。

Q：我想问下你们openstack的 cinder swift 底层存储是用什么技术实现的？”

A: 我们还没有在生产环境上正式集成cinder和swift，线下正在预研的是和Ceph的集成。

Q：请问容器IP是静态编排还是动态获取的？

A: 这个跟运维所管理的网络模式有关，我们内部的网络没有DHCP服务，因此对于IaaS层，容器的IP是静态分配的。对于PaaS层来说，如果有DHCP服务，容器的App所暴露出来IP和端口就可以做到动态的。

Q：请问你们当时部署的时候有没有尝试过用Ubuntu？有没有研究过两个系统间的区别？另外请问你们在Openstack上是怎样对这些虚拟机监控的？

A: 我们没有尝试过Ubuntu，因为公司生产环境上用的是CentOS。我们的中间件团队负责公司机器的监控，我们和监控团队配合，将监控的agent程序部署到宿主机和每个容器里，这样就可以当成虚拟机来进行监控。

当然，容器的数据是需要从cgroups里来取，这部分提取数据的工作，是我们来实现的。

Q：容器间的网络选型有什么建议？据说采用虚拟网卡比物理网卡有不小的性能损失？docker自带的weaves和ovs能胜任吗？

A: 容器的网络不建议用默认的NAT方式，因为NAT会造成一定的性能损失。之前我的分享中提到过，不需要启动iptables，docker的性能接近物理机的95%。docker的weaves底层应该还是采用了网桥或者openvswitch。建议可以看一下novadocker的源码，这样会比较容易理解。

Q：静态ip通过lxc实现的吗？

A: 静态ip的实现是在novadocker的novadocker/virt/docker/vifs.py中实现的。实现的原理就是通过ip命令添加 veth pair，然后用ip link set/ip netns exec等一系列命令来实现的。设置的原理和weaves类似。

Q：容器内的进程gdb你们怎么弄的？把gdb打包到容器内吗？

A: 容器内的gdb不会有问题的，可以直接yum install gdb。

Q：共享存储能直接mount到容器里吗？

A: 虽然没试过，但这个通过docker -v的方式应该没什么问题。

Q：不启动docker daemon的情况下，离线恢复docker中的数据是咋做到的？

A: 离线恢复的原理是用dmsetup create命令创建一个临时的dm设备，映射到docker实例所用的dm设备号，通过mount这个临时设备，就可以恢复出原来的数据。

Q：docker的跨物理机冷迁移，支持动态的CPU扩容／缩容，网络IO磁盘IO的限速，是怎么实现的，能具体说说吗？

A：docker的冷迁移是通过修改novadocker，来实现OpenStack迁移的接口，具体来说，就是在两台物理机间通过docker commit，docker push到内部的registry，然后docker pull snapshot来完成的。

动态的CPU扩容／缩容，网络IO磁盘IO的限速主要是通过novadocker来修改cgroups中的cpuset, iops, bps，还有TC的参数来实现的。

Q：请问你们未来会不会考虑使用magnum项目，还是会选择swarm？

A：这些都是我们备选的方案，可能会考虑swarm。因为magnum底层还是调用了kubernetes这样的集群管理方案，与其用magnum，不如直接选择swarm或者是kubernetes。当然，这只是我个人的看法。

Q：你们的业务是基于同一个镜像么？如果是不同的镜像，那么计算节点如何保证容器能够快速启动？

A：运维会维护一套统一的基础镜像。其他业务的镜像会基于这个镜像来制作。我们在初始化计算节点的时候就会通过docker pull把基础镜像拉到本地，这也是很多公司通用的做法，据我了解，腾讯，360都是类似的做法。

Q：如果基础镜像需要打补丁的话？如何做？

A：基础镜像需要打补丁，那其他依赖的也是需要升级的，这个我们没有什么好的办法，也想问一下大家是怎么做的。

Q：做热迁移，有没有考虑继续使用传统共享存储的来做？

A：分布式存储和共享存储都在考虑范围内，我们下一步，就计划做容器的热迁移。

Q：请问你们是直接讲公网IP绑定到容器吗？还是通过其他方式映射到容器的私有IP，如果是映射如何解决原本二层的vlan隔离？

A：因为我们是私有云，不涉及floating ip的问题，所以你可以认为是公网IP。VLAN的二层隔离完全可以在交换机上作。我们用openvswitch划分不同的vlan，就实现了docker容器和物理机的网络隔离。

Q：Device mapper dm-thin discard问题能说的详细些吗？

A：4月份的时候，有两台宿主机经常无故重启。首先想到的是查看/var/log/messages日志，但是在重启时间点附近没有找到与重启相关的信息。而后在/var/crash目录下，找到了内核crash的日志vmcore-dmesg.txt。日志的生成时间与宿主机重启时间一致，可以说明宿主机是发生了kernel crash然后导致的自动重启。“kernel BUG at drivers/md/persistent-data/dm-btree-remove.c:181!”。从堆栈可以看出在做dm-thin的discard操作（processprepareddiscard），虽然不知道引起bug的根本原因，但是直接原因是discard操作引发的，可以关闭discard support来规避。

我们将所有的宿主机配置都禁用discard功能后，再没有出现过同样的问题。

在今年CNUTCon的大会上，腾讯和大众点评在分享他们使用Docker的时候也提到了这个crash，他们的解决方法和我们完全一样。

Q：阈值监控和告警那块，有高中低多种级别的告警吗？如果当前出现低级告警，是否会采取一些限制用户接入或者砍掉当前用户正在使用的业务？还是任由事态发展？

A：告警这块，运维有专门的PE负责线上业务的稳定性。当出现告警时，业务方和PE会同时收到告警信息。如果是影响单个虚拟机的，PE会告知业务方，如果严重的，甚至可以及时下掉业务。我们会和PE合作，让业务方及时将业务迁移走。

Q：你们自研的container tools有没有开源，github上有没有你们的代码？如何还没开源，后期有望开源吗？关于监控容器的细粒度，你们是如何考虑的？

A：虽然我们目前还没有开源，单我觉得开源出来的是完全没问题的，请大家等我们的好消息。关于监控容器的细粒度，主要想法是在宿主机层面来监控容器的健康状态，而容器内部的监控，是由业务方来做的。

Q：请问容器的layer有关心过层数么？底层的文件系统是ext4么？有优化策略么？

A：当然有关心，我们通过合并镜像层次来优化docker pull镜像的时间。在docker pull时，每一层校验的耗时很长，通过减小层数，不仅大小变小，docker pull时间也大幅缩短。

Q：容器的memcg无法回收slab cache，也不对dirty cache量进行限制，更容易发生OOM问题。----这个缓存问题你们是怎么处理的？

A：我们根据实际的经验值，把一部分的cache当做used内存来计算，尽量逼近真实的使用值。另外针对容器，内存报警阈值适当调低。同时添加容器oom的告警。如果升级到centos7，还可以配置kmem.limit_in_bytes来做一定的限制。

Q：能详细介绍下你们容器网络的隔离？

A：访问隔离，目前二层隔离我们主要用vlan，后面也会考虑vxlan做隔离。网络流控，我们是就是使用OVS自带的基于port的QoS，底层用的还是TC，后面还会考虑基于flow的流控。

Q：请问你们这一套都是用的centos6.5吗？这样技术的实现。是运维还是开发参与的多？

A：生产环境上稳定性是第一位的。centos6.5主要是运维负责全公司的统一维护。我们会给运维在大版本升级时提建议。同时做好虚拟化本身的稳定性工作。

Q：请问容器和容器直接是怎么通信的?网络怎么设置？

A：你是指同一台物理机上的吗？我们目前还是通过IP方式来进行通信。具体的网络可以采用网桥模式，或者VLAN模式。我们用openvswitch支持VLAN模式，可以做到容器间的隔离或者通信。

Q：你们是使用nova-api的方式集成dcoker吗？docker的高级特性是否可以使用？如docker-api，另外为什么不使用heat集成docker？

A：我们是用novadocker这个开源软件实现的，novadocker是StackForge上一个开源项目，它做为nova的一个插件，替换了已有的libvirt，通过调用Docker的RESTful接口来控制容器的启停等动作。

使用heat还是nova来集成docker业界确实一直存在争议的，我们更多的是考虑我们自身想解决的问题。Heat本身依赖的关系较为复杂，其实业界用的也并不多，否则社区就不会推出Magnum了。

Q：目前你们有没有容器跨DC的实践或类似的方向？

A：我们已经在多个机房部署了多套集群，每个机房有一套独立的集群，在此之上，我们开发了自己的管理平台，能够实现对多集群的统一管理。同时，我们搭建了docker registry v1，内部准备升级到docker registry v2，能够实现docker镜像的跨DC mirror功能。

Q：我现在也在推进DOCKER的持续集成与集群管理，但发现容器多了管理也是个问题，比如容器的弹性管理与资源监控，Kubernetes／Mesos哪个比较好一些，如果用在业务上，那对外的域名解析如何做呢，因为都是通过宿主机来通信，而它只有一个对外IP？

A：对于Kubernetes和Mesos我们还在预研阶段，我们目前的P层调度是自研的，我们是通过etcd来维护实例的状态，端口等信息。对于7层的可以通过nginx来解析，对于4层，需要依赖于naming服务。我们内部有自研的naming服务，因此我们可以解决这些问题。对外虽然只有一个IP，但是暴露的端口是不同的。

Q：请问你们有考虑使用 hyper hypernetes吗？实现容器与宿主机内核隔离同时保证启动速度?

A：Hyper我们一直在关注，hyper是个很不错的想法，未来也不排除会使用hyper。其实我们最希望hyper实现的是热迁移，这是目前docker还做不到的。

Q：问个基础问题，请问你们宿主机一般用的什么配置？独立主机还是云服务器？

A：我们有自己的机房，用的是独立的服务器，物理机。

Q：容器跨host通信使用哪一种解决方案？

A：容器跨host就必须使用3层来通信，也就是IP，容器可以有独立的IP，或者宿主机IP＋端口映射的方式来实现。我们目前用的比较多的还是独立ip的方式，易于管理。

Q：感觉贵公司对docker的使用比较像虚拟机，为什么不直接考虑从容器的角度来使用，是历史原因么？

A：我们首先考虑的是用户的接受程度和改造的成本。从用户的角度来说，他并不关心业务是跑在容器里，还是虚拟机里，他更关心的是应用的部署效率，对应用本身的稳定性和性能的影响。从容器的角度，一些业务方已有的应用可能需要比较大的改造。比如日志系统，全链路监控等等。当然，最主要的是对已有运维系统的冲击会比较大。容器的管理对运维来说是个挑战，运维的接受是需要一个过程的。

当然，把docker当成容器来封装应用，来实现PaaS的部署和动态调度，这是我们的目标，事实上我们也在往这个方向努力。这个也需要业务方把应用进行拆分，实现微服务化，这个需要一个过程。

Q：其实我们也想用容器当虚拟机使用。你们用虚拟机跑什么中间件？我们想解决测试关键对大量相对独立环境weblogic的矛盾？

A：我们跑的业务有很多，从前台的主站Web，到后端的中间件服务。我们的中间件服务是另外团队自研的产品，实现前后台业务逻辑的分离。

Q：贵公司用OpenStack同时管理docker和KVM是否有自己开发web配置界面？还是单纯用API管理？

A：我们有自研的web管理平台，我们希望通过一个平台管理多个集群，并且对接运维，日志，监控等系统，对外暴露统一的API接口。

Q：上面分享的一个案例中，关于2.6内核namespace的bug，这个低版本的内核可以安装docker环境吗？docker目前对procfs的隔离还不完善，你们开发的container tools是基于应用层的还是需要修改内核？

A：安装和使用应该没问题，但如果上生产环境，是需要全面的考虑的，主要还是稳定性和隔离性不够，低版本的内核更容易造成系统crash或者各种严重的问题，有些其实不是bug，而是功能不完善，比如容器内创建网桥会导致crash，就是network namespace内核支持不完善引起的。

我们开发的container tools是基于应用的，不需要修改内核。

Q：关于冗灾方面有没有更详细的介绍，比如离线状态如何实现数据恢复的？

A：离线状态如何实现恢复数据，这个我在之前已经回答过了，具体来说，是用dmsetup create命令创建一个临时的dm设备，映射到docker实例所用的dm设备号，通过mount这个临时设备，就可以恢复出原来的数据。其他的冗灾方案，因为内容比较多，可以再另外组织一次分享了。你可以关注一下 http://mogu.io/ ，到时候我们会分享出来。

Q：贵公司目前线上容器化的系统，无状态为主还是有状态为主，在场景选择上有什么考虑或难点？

A：互联网公司的应用主要是以无状态的为主。有状态的业务其实从业务层面也可以改造成部分有状态，或者完全不状态的应用。不太明白你说的场景选择，但我们尽量满足业务方的各种需求。

对于一些本身对稳定性要求很高，或对时延IO特别敏感，比如redis业务，无法做到完全隔离或者无状态的，我们不建议他们用容器。

=============================================================

以上内容根据2015年11月03日晚微信群分享内容整理。分享人：郭嘉，蘑菇街平台技术部高级工程师，虚拟化组责任人。2014年加入蘑菇街，目前主要专注于蘑菇街的私有云建设，关注Docker，KVM，OpenStack，Kubernetes等领域。DockOne每周都会组织定向的技术分享，欢迎感兴趣的同学加微信： liyingjiesx ，进群参与，您有想听的话题可以给我们留言。

蘑菇街基于Docker的私有云实践

内容

架构

集群管理

网络和存储

容器的监控

体会和思考

Q&A

相关资讯