图片无法查看,可以访问这个链接阅读:https://zhuanlan.zhihu.com/p/338057286
Jepsen(项目主页)是开源的分布式测试框架,基于Clojure语言,支持各种错误注入。目前广泛应用在各种分布式系统的测试中,尤其是一致性协议实现的测试中。Jepsen测试中支持验证系统的线性一致性,关于线性一致性,中文的介绍非常少,目前网上能搜到的大概只有tidb(一个创业公司PingCAP研发的分布式数据库)的一篇Linearizability 一致性验证。
银河里的星星
图片无法查看,可以访问这个链接阅读:https://zhuanlan.zhihu.com/p/338057286
Jepsen(项目主页)是开源的分布式测试框架,基于Clojure语言,支持各种错误注入。目前广泛应用在各种分布式系统的测试中,尤其是一致性协议实现的测试中。Jepsen测试中支持验证系统的线性一致性,关于线性一致性,中文的介绍非常少,目前网上能搜到的大概只有tidb(一个创业公司PingCAP研发的分布式数据库)的一篇Linearizability 一致性验证。 read more
作者:Leslie Lamport 1979
原文:
make-multiprocessor-computer-correctly-executes-multiprocess-programs
译者:phylips@bmy 2018-03-24
译文:http://duanple.blog.163.com/blog/static/70971767201822515346732/
高速处理器可能乱序执行程序。如果处理器满足如下条件就可以保证执行的正确性:执行的结果与按照程序描述的顺序执行的结果一致。满足该条件的处理器我们就认为是sequential的。假设一台计算机由共享内存的多个这样的处理器组成。在设计和证明运行在该计算机上的多进程算法[1]-[3]的正确性时,通常基于如下假设:执行结果与这些处理器以某一串行顺序执行的结果相同,同时每个处理器内部操作的执行看起来又与程序描述的顺序一致。满足该条件的多处理器系统我们就认为是sequential consistent的。每个处理器内部满足sequential并不保证多处理器系统是sequential consistent的。在本文中,我们描述了一种sequential处理器(具有内存模块)之间的互联方法,可以保证最终的多处理器系统是sequential consistent的。 read more
欢迎使用WordPress。这是系统自动生成的演示文章。编辑或者删除它,然后开始您的博客!
wp-config.php,添加以下代码
define(“FS_METHOD”,”direct”);
define(“FS_CHMOD_DIR”, 0777);
define(“FS_CHMOD_FILE”, 0777);
搞定.这时又会提醒无法安装,理由是文件无法创建目录,这个好解决.给wordpress添加权限就好 read more
序
AddressSanitizer&ThreadSanitizer都是最初由Google开发的,用于运行时检测C/C++程序中的内存错误和多线程data race的,俗话说“Google出品,必属精品”。首先它们都非常新,最近几年才出来的,有很多先进的地方,弥补了现有一些工具的很多不足,代表了先进生产力的发展方向。比如它们都采用了CTI(CompileTime Instrumentation)技术,即在编译时进行代码插入,运行速度快,比传统的Valgrind等工具速度上要快一个数量级。它们的输出信息都非常详细,方便快速地定位问题。AddressSanitizer除了可以发现堆上内存越界外,还可以检查到栈及全局变量的越界访问,这是很多内存检查工具无法做到的。 read more
作者:Jim Gray & Leslie Lamport 2004
原文:http://research.microsoft.com/pubs/64636/tr-2003-96.pdf
译者:phylips@bmy 2013-10-07
译文:http://duanple.blog.163.com/blog/static/70971767201419111256135/
[序:很早之前就注意到这篇文章了,冲着这超豪华的作者阵容当时二话不说就将它加入到了待读列表中,只是最近才有时间将它看完。提到Paxos,人们会禁不住想到Lamport,提到事务,那当仁不让就是Jim Gray了。而由这两位所写的关于Paxos和事务提交的文章,还有让你错过的理由吗? read more
作者:DAG BELSNES 1976
原文:http://ieeexplore.ieee.org/xpl/tocresult.jsp?isnumber=23863
译者:phylips@bmy 2012-11-28
译文:http://duanple.blog.163.com/blog/static/70971767201310194243109/
摘要
当通信系统需要传输大量短消息时,减少进程间连接(connection)的创建和销毁以及消息可靠性方面的控制开销是非常重要的。本文描述了几种不同的端到端控制流程,同时研究了它们是否会导致消息丢失及收到重复消息。结果表明(基于对通信网络的一定假设)所有的端到端协议要么会产生消息丢失,要么会导致重复。 read more
作者:Tyler Akidau, Alex Balikov etc. Google Inc.
原文:http://research.google.com/pubs/pub41378.html
译者:phylips@bmy 2013-10-1
译文:http://duanple.blog.163.com/blog/static/709717672013918101253853/
[说明:最近Google在VLDB上发表了两篇文章,其中一篇是F1,另外一篇就是此文。关于流处理,目前业界也已有如下多个系统:Storm,Samza,Summingbird,Spark Streaming,StreamBase。另外,highscalability.com上也有个关于这篇paper的推荐文章Paper: MillWheel: Fault-Tolerant Stream Processing At Internet Scale,Zeitgeist。] read more
作者:Rajagopal Ananthanarayanan, Venkatesh Basker etc. Google Inc.
原文:http://www.mpi-sws.org/~areznich/files/photon-sigmod13.pdf
译者:phylips@bmy 2013-9-1
译文:http://duanple.blog.163.com/blog/static/70971767201382591541823/
摘要
Photon是Google开发的用于实时地对多个连续数据流进行join的部署于多个地理位置的分布式系统,具有高扩展性和低延迟的特点。该系统可以在不需要人工干预的情况下,完全容忍设施降级和数据中心级的故障。在Google内部,该系统是与广告系统一起部署的,可以用来对像网页搜索请求和广告点击这样的数据流进行join,它的输出结果是进行广告客户费用结算的重要依据。目前的线上环境中,峰值情况下每分钟要处理数百万的事件,平均延迟低于10秒。本文我们会描述在跨地理位置情况下,维护大规模持久化状态遇到的那些挑战和解决方案,并着重讲述下那些源于实践过程的设计原则。 read more
作者:phylips@bmy 2013-02
本文主要是从内部实现的角度来认识下Storm(0.7.1版本),因此需要用户对Storm的基本原理和使用具有一定的了解。如果缺乏这方面的知识,建议首先阅读下Storm的官方wiki:https://github.com/nathanmarz/storm/wiki read more
James Hamilton – Windows Live Services Platform 2007
原文:http://www.mvdirona.com/jrh/TalksAndPapers/JamesRH_Lisa.pdf
译者:phylips@bmy 2013-06-10
译文:http://duanple.blog.163.com/blog/static/709717672013511101045985/
发布周期和测试
在生产环境下的测试是必需的,所有的大规模服务都应该把它作为QA方案的一部分。对于大多数服务来说,都至少会有一个尽可能接近生产的测试环境,同时所有优秀的工程团队都会用实际的生产负载来驱动测试系统。但我们的经验表明,无论测试环境有多好,总是不可能会与生产环境完全一致。与生产相比,总是或多或少会有些差别。随着测试环境与生产系统的接近,成本也会逐步与生产系统相当。 read more
作者:James Hamilton – Windows Live Services Platform 2007
原文:http://www.mvdirona.com/jrh/TalksAndPapers/JamesRH_Lisa.pdf
译者:phylips@bmy 2013-06-01
译文:http://duanple.blog.163.com/blog/static/70971767201352105348729/
[序:James Hamilton,连线,主页,blog。James Hamilton目前是亚马逊AWS的VP和杰出工程师,专注于基础设施的效率、可靠性和可伸缩性。 read more
作者:Jim Gray 1985
原文:http://www.hpl.hp.com/techreports/tandem/TR-85.7.pdf
译者:phylips@bmy 2013-04-30
译文:http://duanple.blog.163.com/blog/static/7097176720134189481819/
[序:早在互联网出现以前,Tandem Computers 就已经构建了具有高度容错性和可用性的系统。Tandem Computers 是最早从事容错服务器制造的厂商,它制造的机器广泛应用在银行证券等在线处理交易领域。本文即是Jim Gray在Tandem Computers工作期间所撰写的,文中揭示了Tandem Computers 的“NonStop”神话所依赖的那些重要技术:isolation、failing fast、transactional updates、process pairs、supervision。同时提出了容错领域的很多重要概念,诸如:Availability 、Reliability 、MTBF、MTTR。虽然这篇文章是写在1985年,距今已30年,但是影响深远,其中的很多内容即使在今天看来依然非常有意义。 read more
zz from:http://english.turkcebilgi.com/null+(sql)
Null is a special marker used to indicate that a data value is unknown in the Structured Query Language (SQL). Introduced by the creator of the relationaldatabase model, Dr. E.F. Codd,SQL Null serves to fulfill the requirement that all true relational database management systems (RDBMS) support a representation of "missing information and inapplicable information". Dr. Codd also introduced the use of the lowercase Greek omega (ω) symbol to represent Null indatabase theory. NULL is also an SQL reserved keyword used to identify the Null special marker. read more
作者:Jeffrey Dean, Luiz André Barroso Google Inc 2013-2
原文:http://cacm.acm.org/magazines/2013/2/160173-the-tail-at-scale/fulltext
译者:phylips@bmy 2013-02-23
译文:http://duanple.blog.163.com/blog/static/7097176720133511217445/
序
那些可以对用户动作进行快速响应(100ms以内)的系统与那些响应慢的系统相比,可以提供更自然流畅的体验。随着Internet连通性的提高以及warehouse-scale 计算系统的出现,使得web服务可以在访问存在数千台服务器上的TB级数据的同时还能保持流畅的响应;比如Google搜索系统会根据用户类型对查询结果进行交互式更新,会基于用户当前已经输入的前缀预测用户查询意图,在数十毫秒的时间内执行该查询并完成结果展示。新兴的增强现实(augmented-reality )设备(比如Google Glass)为保证无缝的交互,对相关web服务的快速响应提出了更高要求。 read more
[说明:本文是阅读Google论文“Dapper, a Large-Scale Distributed Systems Tracing Infrastructure”之后的一个简要总结,完整译文可参考此处。 另论文“Uncertainty in Aggregate Estimates from Sampled Distributed Traces”中有关于采样的更详细分析。此外,Twitter开源的Zipkin就是参考Google Dapper而开发。] read more
作者:Philip A. Bernstein, Vassos Hadzilacos, Nathan Goodman. 1987
原文:Concurrency Control and Recovery in Database Systems
译者:phylips@bmy 2013-02-14
译文:http://duanple.blog.163.com/blog/static/70971767201311810939564/
[序:历史上,数据库领域共产生过三位图灵奖得主Charles Bachman,E.F.Codd和Jim Gray read more
按照习惯,还是在这岁月交替之际,写一篇小小的总结吧。虽许久不再写流年,而流年依旧如流年。依旧觉得很快这一年就又过去了。
过去的一年里,起了很多变化,无论是工作还是生活。刚工作的时候,一个人度着周末,经常就是打印个三两篇论文,读着读着就是一天。偶尔还看点闲书,生活倒也惬意,只是颇有些单调。所以在那极单调的日子里,倒也看了不少东西。很多人会觉得能有时间看这么多文章而且还翻译出来的人,一定是在学校或者研究所的吧。其实如果想看,又何需一定是悠闲的人呢。也忘了是哪年哪月读到的了,只是记忆犹新,欧阳修<<归田录>>中有云”余平生所作文章,多在三上,乃马上、枕上、厕上也。盖惟此尤可以属思尔“。其实并不是没有时间,只是需要自己去找,即使每天给自己一个小时的阅读时间,累积下来,一周,一月,一年,只要坚持,就能读很多东西。 read more
Exclusive: a behind-the-scenes look at Facebook release engineering
Release Engineering at Facebook
[译文]Release Engineering at Facebook
Shell/BASH CronTab Expect rsync cacti nagios cfengine ganglia gearman puppet. read more
valgrind 详细说明
http://www.cnblogs.com/wangkangluo1/archive/2011/07/20/2111273.html
近期Imgsrc一处内存泄露问题的查找和解决 http://rdc.taobao.com/blog/cs/?p=1651
应用 Valgrind 发现 Linux 程序的内存问题 https://www.ibm.com/developerworks/cn/linux/l-cn-valgrind/ read more
作者:Tushar Chandra&Rebert Griesemer&Joshua Redstone 2007 Google.Inc
原文:http://labs.google.com/papers/paxos_made_live.pdf
译者:phylips@bmy 2012-11-28
译文:http://duanple.blog.163.com/blog/static/7097176720121123114918404/
[序:Google在它的分布式系统中,大量使用了Paxos,比如Chubby、MegaStore、Spanner等系统中。这篇文章详细讲述了最初实现Paxos碰到的一系列问题及解决方案,是一篇全面讲解分布式系统工程实践的文章。其中提到的很多真实发生的场景,相信做过分布式系统的人都会感同身受,每个人或多或少都会遇到过一些类似的问题。与理论界的文章相比,这篇文章显得非常实际,所有内容都来自Google一线工程师的实战,非常值得一看。] read more